技术文章 > 后端开发 > Python教程

如何完整写一个爬虫框架

零到壹度 原创: 2018-03-30 11:28:40 4062浏览

本文主要为大家分享一篇如何完整写一个爬虫框架的请求方法，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧，希望能帮助到大家。

产生爬虫框架：

1、建立一个scrapy爬虫工程

2、在工程中产生一个scrapy爬虫

3、配置spider爬虫

4、运行爬虫，获取网页

具体操作：

1、建立工程

定义一个工程，名称为：python123demo

方法：

在cmd中，d: 进入d盘， cd pycodes 进入文件pycodes

然后输入

scrapy startproject python123demo

在pycodes中会生成一个文件：

_init_.py不需要用户编写

2、在工程中产生一个scrapy爬虫

执行一条命令，给出爬虫名字和爬取的网站

产生爬虫：

生成一个名称为 demo 的spider

仅限生成 demo.py,其内容为：

name = 'demo' 当前爬虫名字为demo

allowed_domains = " 爬取该网站域名以下的链接，该域名由cmd命令台输入

start_urls = [] 爬取的初始页面

parse()用于处理相应，解析内容形成字典，发现新的url爬取请求

3、配置产生的spider爬虫，使之满足我们的需求

将解析的页面保存成文件

修改demo.py文件

4、运行爬虫，获取网页

打开cmd输入命令行进行爬虫

然后我的电脑上出现了一个错误

windows系统上出现这个问题的解决需要安装Py32Win模块，但是直接通过官网链接装exe会出现几百个错误，更方便的做法是

pip3 install pypiwin32

这是py3的解决方案

注意：py3版本如果用 pip install pypiwin32指令会发生错误

安装完成后，重新进行爬虫，成功！撒花！

捕获页面存储在 demo.html文件中

demo.py 所对应的完整代码：

两版本等价：

以上就是如何完整写一个爬虫框架的详细内容，更多请关注php中文网其它相关文章！

框架 Python PHP课程 HTML视频教程 CSS视频 JS视频教程 Vue视频教程

声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn核实处理。

上一条：Python之爬取其他网页下一条：python操作文件方法

相关文章

查看更多

热门课程

TP6.0 搭建个人博客实战（玉女心经版）

￥71
￥79

已抢187095个
抢
php mysql实战：学生信息管理系统（玉女心经版）

￥89
￥99

已抢67502个
抢
CSS视频教程-玉女心经版

￥62
￥69

已抢353776个
抢
JavaScript极速入门_玉女心经系列

￥62
￥69

已抢668465个
抢
零基础php开发视频教程VIP视频课

￥99
￥299

已抢123873个
抢
前端基础到实战（HTML5+CSS3+ES6+NPM）

￥800
￥1200

已抢26075个
抢

打开APP，随时随地在线学习！