最新下载
热门教程
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
Python处理文本文件中控制字符的方法
时间:2017-03-17 编辑:简简单单 来源:一聚教程网
控制字符
控制字符(Control Character),或者说非打印字符,出现于特定的信息文本中,表示某一控制功能的字符,如控制符:LF(换行)、CR(回车)、FF(换页)、DEL(删除)、BS(退格)、BEL(振铃)等;通讯专用字符:SOH(文头)、EOT(文尾)、ACK(确认)等。
具体控制字符一共有下面两个集合:
七位ASCII定义了33个代码作为控制字符,它们是0到31、以及127,(位于0x00-0x1F及0x7F)。
兼容的八位ISO/IEC 8859-1加上了从ISO/IEC 6429定义的从128到159的32个代码,位于0x80-0x9F。
控制字符列表:http://ascii-table.com/control-chars.php
Python解决控制字符的方案:(未一一验证)
方案一:
代码如下 | 复制代码 |
strip_control_characters=lambdas:"".join(iforiinsif31 |
方案二:
代码如下 | 复制代码 |
defstrip_control_characters(str_input): ifstr_input: importre # unicode invalid characters RE_XML_ILLEGAL=u'([\u0000-\u0008\u000b-\u000c\u000e-\u001f\ufffe-\uffff])'+\ u'|'+\ u'([%s-%s][^%s-%s])|([^%s-%s][%s-%s])|([%s-%s]$)|(^[%s-%s])'%\ (unichr(0xd800),unichr(0xdbff),unichr(0xdc00),unichr(0xdfff), unichr(0xd800),unichr(0xdbff),unichr(0xdc00),unichr(0xdfff), unichr(0xd800),unichr(0xdbff),unichr(0xdc00),unichr(0xdfff), ) str_input=re.sub(RE_XML_ILLEGAL, "",input) # ascii control characters str_input=re.sub(r"[\x01-\x1F\x7F]", "",input) returnstr_input |
方案三:
代码如下 | 复制代码 |
importre
defremove_control_chars(s): control_chars=''.join(map(unichr,range(0,32)+range(127,160))) control_char_re=re.compile('[%s]'%re.escape(control_chars))
returncontrol_char_re.sub('', s)
cleaned_json=remove_control_chars(original_json) obj=simplejson.loads(cleaned_json) |
-
上一个: PHP验证终端类型是否为手机的简单实例
相关文章
- PHP导出数据超时的优化建议解读 10-31
- PHP之mysql位运算解析 10-31
- Laravel实现登录跳转功能解析 10-31
- php双向队列解读 10-31
- Laravel异常上下文解决教程 10-24
- php数组查询元素位置方法介绍 10-24