有的说是因为代理.
我的浏览器倒是经常开着代理, 但是我已经关闭了.
我特意查看了下HTTP报文, 也都是没经过代理的.
但还是会出错.
代码:
import urllib.request
url = "http://news.dbanotes.net/"
req = urllib.request.Request(url)
page = urllib.request.urlopen(req).read().decode("UTF-8")
print(page)
python版本: 3.5.1
报错信息:
urllib.error.HTTPError: HTTP Error 404: Not Found
应该可以排除以下的问题:
代理
网络问题
url不存在
代码有错
至于反爬虫这个我应该可能性也不大,
一来我试了很多个URL, 基本就是六四分, 有的能访问, 有的不能, 而且我们学校的官网那么, 我才不信他会...
二来我加了User-Agent的首部还是不能访问.
我这边在windows下的python 3.5.2是没有问题的。
建议你抓包比较一下和浏览器访问时请求有什么不同。
这个有可能是你的agent的设置值有关,因为有的网站会检查这个,来防止非浏览器进行爬虫
你把浏览器中的 headers 和 cookies 复制出来,添加到urllib的Request对象中。
模拟浏览器~~
很重要的一个原因,你程序中请求带过去的agen头被对方封了,换下agen头试试吧。
用不着Request 吧,直接urlopen呢