网页爬虫 - python采集百度新闻的原理是什么?-PHP中文网问答

文章专题 AI工具学习下载问答源码最近更新

PHP

会员中心讲师中心微信公众号

网页爬虫 - python采集百度新闻的原理是什么?

天蓬老师 2017-04-18 09:03:01

[Python讨论组]

0

3

1192

举报

火车头有一个正文提取器,而且不少的采集软件都有这个东西,但是就是一直不知道这些东西到底是怎么实现的?

或是有高人说下实现的原理是多少?

比如步骤?

或是如何用python来实现,可以举个简单的例子

天蓬老师

欢迎选择我的课程，让我们一起见证您的进步~~

全部回复(3)

高洛峰2017-04-18 09:05:01 3楼

来源地址：http://www.cnblogs.com/jasondan/p/3497757.html

赞 +0

添加回复

PHP中文网2017-04-18 09:05:01 2楼

比较针对性的，可以使用p，article这些标签来简单判断。如果需要普遍一点的，可以对采集的网页数据进行分析，比如写一个算法计算中文（非标签文字）的密集性来判断是不是正文。具体没做过，但是思路基本是这样。

赞 +0

添加回复

PHP中文网2017-04-18 09:05:01 1楼

HTTP协议模拟,(通常用request,urllib2模块)
信息提取(由于HTML文档特殊性,一般会用xpath,beautifulsoup)

赞 +0

添加回复

专题推荐

更多>

热门话题

热门教程

更多>

相关教程

热门推荐

最新课程

轻松掌握Composer软件依赖工具（玉女心经版）

12682次学习
收藏
Mac PHP开发工具与环境搭建

17196次学习
收藏

最新下载

更多>

网站特效

网站源码

网站素材

前端模板

关于我们免责申明意见反馈讲师合作广告合作最新更新: php中文网：公益在线php培训，帮助PHP学习者快速成长！; 关注服务号技术交流群

PHP中文网订阅号: 每天精选资源文章推送

PHP中文网APP: 随时随地碎片化学习

PHP中文网抖音号: 发现有趣的

Copyright 2014-2025 //m.sbmmt.com/ All Rights Reserved | php.cn | 湘ICP备2023035733号

PHP学习

技术支持

返回顶部