python - utf8编码规则会受制于Unicode实际的字符对应吗？-PHP中文網路問答

文章專題學習下載問答程式設計字典遊戲最近更新

简体中文(ZH-CN) English(EN) 繁体中文(ZH-TW) 日本語(JA) 한국어(KO) Melayu(MS) Français(FR) Deutsch(DE)

python - utf8编码规则会受制于Unicode实际的字符对应吗？

迷茫 2017-04-17 14:52:32

0

1

402

我用python 写
'\xF5\x90\x90\x90'.decode('utf8')
但是报错了：

UnicodeDecodeError: 'utf8' codec can't decode byte 0xf5 in position 0: invalid start byte

问题是：\xF5\x90\x90\x90是个标准的四字节的utf8编码的字符啊
转换成二进制就是11110101 10010000 10010000 10010000
完全符合utf8编码规则：11110xxx 10xxxxxx 10xxxxxx 10xxxxxx

我把\xF5换成\xF2就没有问题了，也就是11110010开头，难道是因为Unicode实际上没有用到这么多的字符，所以不能decode('utf8')？但是规则是对的呀，万一哪天Unicode又扩充了很多字符集，那python的decode()函数岂不是要更新了？

迷茫

业精于勤，荒于嬉;行成于思，毁于随。

全部回覆 (1)

Peter_Zhu2017-04-17 14:54:32 1樓

因为Unicode的范围是0x0000-0x10FFFF，我测试了一下，python中比规范更为宽松，最大支持到0xFFFFF,而你题目中输的已经超过这个范围所以报错了。
附：UTF-8标准 RFC3629

點贊+0

新增回覆

熱門專題

更多>

熱門文章

熱門教學

更多>

相關教學

熱門推薦

最新課程

最新ThinkPHP 5.1全球首發影片教學(60天成就PHP大牛線上訓練課程)

1394818
php入門教程之一週學會PHP

4206520
JAVA 初級入門影片教學

2348841

最新下載

更多>

網站特效

網站源碼

網站素材

前端模板

關於我們免責聲明 Sitemap: PHP中文網：公益線上PHP培訓，幫助PHP學習者快速成長！