技术文章 > 后端开发 > Python教程

【python教程】网页正文及内容图片提取算法

黄舟原创: 2017-02-07 16:16:56 2108浏览

抓取单个网站网页内容时通常采用正则匹配的方式，但不同网站之间结构千奇百怪，很难用统一的正则表达式进行匹配。《基于行块分布函数的通用网页正文抽取算法》的作者总结了一般从网页中提取文章正文的方法，提出基于行块分布的正文抽取算法，并给出了 PHP 、Java 等实现。这一算法的主要原理基于两点：1、正文区密度：在去除HTML中所有tag之后，正文区字符密度更高，较少出现多行空白；2、行块长度：非正文区域的内容一般单独标签（行块）中较短。算法步骤如下：

1、去除所有tag，包括样式、Js脚本内容等，但保留原有的换行符\n

2、将网页内容按行分割，定义行块 $block_i$ 为第 $[i, i + blockSize]$ 行文本之和并给出行块长度基于行号的分布函数：

3、正文出现在最长的行块，截取两边至行块长度为 0 的范围：

4、如果需要提取正文区域出现的图片，只需要在第一步去除tag时保留<img>标签的内容：

以上就是【python教程】网页正文及内容图片提取算法的内容，更多相关内容请关注PHP中文网（m.sbmmt.com）！

网页正文内容图片 python PHP课程 HTML视频教程 CSS视频 JS视频教程 Vue视频教程

声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn核实处理。

上一条：【Python教程】绘制漂亮的柱状图下一条：【Python教程】地理可视化

相关文章

查看更多

热门课程

Laravel 9 学习正当时—保姆级教程，想学不会都难！

￥229
￥279

已抢66704个
抢
前端基础到实战（HTML5+CSS3+ES6+NPM）

￥800
￥1200

已抢38371个
抢
PHP基础到实战（PHP+MySQL）

￥800
￥1200

已抢21209个
抢
PHP入门到实战消息队列RabbitMQ

￥59
￥99

已抢2678个
抢
C#+WPF上位机开发课程（模块化与反应式编程）

￥246
￥499

已抢1356个
抢
在线商城系统开发（Laravel实战五）

￥159
￥299

已抢19199个
抢

打开APP，随时随地在线学习！