Python实现简单文本字符串处理的方法-Tutorial Python-php.cn

Python实现简单文本字符串处理的方法

不言

Lepaskan： 2018-05-04 15:42:26

asal

1517 orang telah melayarinya

这篇文章主要介绍了Python实现简单文本字符串处理的方法,涉及Python针对文本字符串的切割、计算、转换等相关操作技巧,需要的朋友可以参考下

本文实例讲述了Python实现简单文本字符串处理的方法。分享给大家供大家参考，具体如下：

对于一个文本字符串，可以使用Python的string.split()方法将其切割。下面看看实际运行效果。

mySent = &#39;This book is the best book on python!&#39;
print mySent.split()

Salin selepas log masuk

输出：

[&#39;This&#39;, &#39;book&#39;, &#39;is&#39;, &#39;the&#39;, &#39;best&#39;, &#39;book&#39;, &#39;on&#39;, &#39;python!&#39;]

Salin selepas log masuk

可以看到，切分的效果不错，但是标点符号也被当成了词，可以使用正则表达式来处理，其中分隔符是除单词、数字外的任意字符串。

import re
reg = re.compile(&#39;\\W*&#39;)
mySent = &#39;This book is the best book on python!&#39;
listof = reg.split(mySent)
print listof

Salin selepas log masuk

输出为：

[&#39;This&#39;, &#39;book&#39;, &#39;is&#39;, &#39;the&#39;, &#39;best&#39;, &#39;book&#39;, &#39;on&#39;, &#39;python&#39;, &#39;&#39;]

Salin selepas log masuk

现在得到了一系列词组成的词表，但是里面的空字符串需要去掉。

可以计算每个字符串的长度，只返回大于0的字符串。

import re
reg = re.compile(&#39;\\W*&#39;)
mySent = &#39;This book is the best book on python!&#39;
listof = reg.split(mySent)
new_list = [tok for tok in listof if len(tok)>0]
print new_list

Salin selepas log masuk

输出为：

[&#39;This&#39;, &#39;book&#39;, &#39;is&#39;, &#39;the&#39;, &#39;best&#39;, &#39;book&#39;, &#39;on&#39;, &#39;python&#39;]

Salin selepas log masuk

最后，发现句子中的第一个字母是大写的。我们需要同一形式，把大写转化为小写。Python内嵌的方法，可以将字符串全部转化为小写(.lower())或大写(.upper())

import re
reg = re.compile(&#39;\\W*&#39;)
mySent = &#39;This book is the best book on python!&#39;
listof = reg.split(mySent)
new_list = [tok.lower() for tok in listof if len(tok)>0]
print new_list

Salin selepas log masuk

输出为：

[&#39;this&#39;, &#39;book&#39;, &#39;is&#39;, &#39;the&#39;, &#39;best&#39;, &#39;book&#39;, &#39;on&#39;, &#39;python&#39;]

Salin selepas log masuk

下面来看一封完整的电子邮件：

内容

Hi Peter,

With Jose out of town, do you want to
meet once in a while to keep things
going and do some interesting stuff?

Let me know
Eugene

Salin selepas log masuk

import re
reg = re.compile(&#39;\\W*&#39;)
email = open(&#39;email.txt&#39;).read()
list = reg.split(email)
new_txt = [tok.lower() for tok in list if len(tok)>0]
print new_txt

Salin selepas log masuk

输出：

复制代码代码如下:

[&#39;hi&#39;, &#39;peter&#39;, &#39;with&#39;, &#39;jose&#39;, &#39;out&#39;, &#39;of&#39;, &#39;town&#39;, &#39;do&#39;, &#39;you&#39;, &#39;want&#39;, &#39;to&#39;, &#39;meet&#39;, &#39;once&#39;, &#39;in&#39;, &#39;a&#39;, &#39;while&#39;, &#39;to&#39;, &#39;keep&#39;, &#39;things&#39;, &#39;going&#39;, &#39;and&#39;, &#39;do&#39;, &#39;some&#39;, &#39;interesting&#39;, &#39;stuff&#39;, &#39;let&#39;, &#39;me&#39;, &#39;know&#39;, &#39;eugene&#39;]

Salin selepas log masuk