首页 > 后端开发 > php教程 > mysql - php根据相似度查找重复数据怎么实现?

mysql - php根据相似度查找重复数据怎么实现?

WBOY
发布: 2016-06-06 20:10:32
原创
1137 人浏览过

有一个具有几千条数据的表,数据库用的mysql,想寻找一个算法根据数据的相似度查找重复的数据,并将其罗列出来,有能提供方法或思路的兄弟们欢迎来凑,先谢过了!

回复内容:

有一个具有几千条数据的表,数据库用的mysql,想寻找一个算法根据数据的相似度查找重复的数据,并将其罗列出来,有能提供方法或思路的兄弟们欢迎来凑,先谢过了!

1.首先,题主应该选一个相似度的计算维度,比如content字段,type字段等;
2.其次,题主考虑一下各个字段的权重,比如type字段必须相同,则让type字段使用typeWeight(例如赋值0.8)作为乘积的因子,而content字段本身是比较长的,所以需要计算出一个hash值,比如使用md5计算出一个32位hash值,然后把这个hash值按照16进制计算得到10进制数,再给一个权重contentWeight(例如0.2),另外再选取一个字段,比如description描述字段,再给一个权重descriptionWeight...
3.最后得到一个当前插入到表中的记录综合hash,typeWeight(contentHashcontentWeight+descriptionHash*descriptionWeight +...),可能会涉及到大整数计算,不过PHP有BCMATH扩展可以使用,最终得到一个数值的综合hash值,保存到数据库的一个字段中,这个东西就可以理解为本条记录的特征值。

看你的需求,方法还是挺多而来,比如说2个字符串的距离,如汉明距离。

相关标签:
来源:php.cn
本站声明
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
热门教程
更多>
最新下载
更多>
网站特效
网站源码
网站素材
前端模板