python - 把搜狗词库转换成可读文件的思路是什么
伊谢尔伦
伊谢尔伦 2017-04-17 15:23:30
0
0
763

我找到这个文章, 我只是好奇作者是如何找到这种方法的,我cat path/to/sogou-dict的结果是乱码,我希望知道这种思路,自己转转其他离线词典(某些linux小众离线词典文件)

update:
主要是下面的代码不懂思路

# 搜狗的scel词库就是保存的文本的unicode编码,每两个字节一个字符(中文汉字或者英文字母) # 找出其每部分的偏移位置即可 def byte2str(data): '''将原始字节码转为字符串''' i = 0; length = len(data) ret = u'' while i < length: x = data[i] + data[i + 1] t = unichr(struct.unpack('H', x)[0]) if t == u'\r': ret += u'\n' elif t != u' ': ret += t i += 2 return ret

这规律是如何找出来的,难道是内部消息?

伊谢尔伦
伊谢尔伦

小伙看你根骨奇佳,潜力无限,来学PHP伐。

全員に返信 (0)
最新のダウンロード
詳細>
ウェブエフェクト
公式サイト
サイト素材
フロントエンドテンプレート
私たちについて 免責事項 Sitemap
PHP中国語ウェブサイト:福祉オンライン PHP トレーニング,PHP 学習者の迅速な成長を支援します!