84669 人學習
152542 人學習
20005 人學習
5487 人學習
7821 人學習
359900 人學習
3350 人學習
180660 人學習
48569 人學習
18603 人學習
40936 人學習
1549 人學習
1183 人學習
32909 人學習
这样算吗?121238asdf
字串如上,類型是'str',要正規獲得漢字。我之前使用[u4e00-u9fa5]結果獲得的還是英文,符號跟數字的list。求教導正確姿勢。另外說說我哪裡寫錯了..
pattern = re.compile(r'[\u4E00-\u9FA5]') print pattern.findall(x[1])
這是我寫的...但是回傳結果就沒有漢字,反而是除漢字外的其他字元。
温故而知新,可以为师矣。 博客:www.ouyangke.com
我這裡假設你需要配對的文字為s:
s
pattern = re.compile(ur"[\u4e00-\u9fa5]") print pattern.findall(s.decode('utf8'))
這裡的decode('utf8')是怕s的值是類似x66x77x88這樣的Unicode雜湊。另外,要注意compile()中ur修飾符,u為Unicode修飾符。
decode('utf8')
x66x77x88
compile()
ur
u
PS:我是從這篇文章得到的啟發。
剛剛看了下樓說的,確實用Python 3就不存在輸出為Unicode散列的情況了,以下摘自此處
Unicode 字串 在Python2中,普通字串是以8位元ASCII碼進行儲存的,而Unicode字串則儲存為16位元unicode字串,這樣能夠表示更多的字元集。使用的語法是在字串前面加上前綴 u。 在Python3中,所有的字串都是Unicode字串。
在Python2中,普通字串是以8位元ASCII碼進行儲存的,而Unicode字串則儲存為16位元unicode字串,這樣能夠表示更多的字元集。使用的語法是在字串前面加上前綴 u。
在Python3中,所有的字串都是Unicode字串。
你用的是python2,uxxxx是unicode字符,匹配後得到的是字節串,print出來是各個字節值。
uxxxx
字節
換python3就沒這個問題了
3
我這裡假設你需要配對的文字為
s
:這裡的
decode('utf8')
是怕s的值是類似x66x77x88
這樣的Unicode雜湊。另外,要注意compile()
中ur
修飾符,u
為Unicode修飾符。PS:我是從這篇文章得到的啟發。
Update
剛剛看了下樓說的,確實用Python 3就不存在輸出為Unicode散列的情況了,以下摘自此處
你用的是python2,
uxxxx
是unicode字符,匹配後得到的是字節
串,print出來是各個字節值。換python
3
就沒這個問題了