社区学习工具库休闲

简体中文

首页 > 后端开发 > Python教程 > 利用python如何爬取js里面的内容

利用python如何爬取js里面的内容

零到壹度

发布： 2018-04-10 09:54:12

原创

9410 人浏览过

本篇文章给大家分享的内容是3利用python如何爬取js里面的内容，有着一定的参考价值，有需要的朋友可以参考一下

一、在编写爬虫软件获取所需内容时可能会碰到所需要的内容是由javascript添加上去的在获取的时候为空比如我们在获取新浪新闻的评论数时使用普通的方法就无法获取

普通获取代码示例：

import requests
from bs4 import BeautifulSoup

res = requests.get(&#39;http://news.sina.com.cn/c/nd/2017-06-12/doc-ifyfzhac1650783.shtml&#39;)
res.encoding = &#39;utf-8&#39;
soup = BeautifulSoup(res.text,&#39;html.parser&#39;)
#取评论数
commentCount = soup.select_one(&#39;#commentCount1&#39;)
print(commentCount.text)

登录后复制

此时所获取的结果为空这是由于内容是存储在js文件中

因此我们需要取寻找存储评论内容的js 经过查找我们发现其存储在改js里

将相应内容放入json数据查看器中我们发现评论总数和评论内容都在该js文件中一json格式存放

在消息头中我们可以看的该js文件的访问路径及请求方式

代码示例

import json
comments = requests.get(&#39;http://comment5.news.sina.com.cn/page/info?version=1&format=js&channel=gn&newsid=comos-fyfzhac1650783&#39;)
comments.encoding = &#39;utf-8&#39;
print(comments)
jd = json.loads(comments.text.strip(&#39;var data=&#39;)) #移除改var data=将其变为json数据
print(jd[&#39;result&#39;][&#39;count&#39;][&#39;total&#39;])

登录后复制

注释：这里解释下为何需要移除 var data= 因为在获取时字符串前缀是包含var data=的其不符合json数据格式因此转化时需将其从请求内容中移除

取评论总数时为何使用jd['result']['count']['total']

以上是利用python如何爬取js里面的内容的详细内容。更多信息请关注PHP中文网其他相关文章！

相关标签：

javascript python 爬取

来源：php.cn

上一篇：Anaconda的新手使用大全下一篇：Python中title()方法的使用

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

作者最新文章

跟我学PS第八天02：光效素材的抠图方法

2018-08-28 15:02:42
跟我学PS第八天01：如何抠取文件中的印章

2018-08-25 10:55:46
跟我学PS第七天02：如何抠出复杂树林

2018-08-20 16:25:41
跟我学PS第七天01：如何将彩图抠出线稿效果

2018-08-18 11:26:54
跟我学PS第六天02：模糊工具

2018-08-14 16:35:58
跟我学PS第六天01：修复画笔工具

2018-07-28 15:36:43
跟我学PS第五天02：移动工具的使用方法和应用

2018-07-27 16:59:00
跟我学PS第五天01：使用裁剪工具

2018-07-27 15:22:47
跟我学PS第四天02：练习Photoshop中的套索工具

2018-07-23 17:56:00
跟我学PS第四天01：如何给照片加边框效果

2018-07-23 16:21:38

最新问题

仅 CSS 方法可在单击时动态修改图像 src，无需使用 JavaScript 我需要仅使用css更改鼠标单击时图像的src喜欢img:active{}

来自于 2024-04-06 19:25:49

0

1

505

放大 d3.js 时散点图点不会保持值这是我第一次使用d3.js，所以请耐心等待。我在vue.js文件中将其作为纯JavaScript实现。我正在尝试制作具有缩放功能的散点图。到目前为止，我几乎一切正常，但当我缩放时，...

来自于 2024-04-06 18:16:26

0

1

403

供应商特定伪元素上的 JavaScript 悬停事件我有以下htmlinput标签。$("input[type='range']::-webkit-slider-thumb").on('hover',functi...

来自于 2024-04-06 15:35:24

0

1

274

使用 Javascript / Jquery 提交表单且不带按钮我试图通过调用JavaScript函数并使用JQUERY/PHP执行表单来提交没有按钮的表单。我希望表单在后端静默执行，而无需重新加载页面。不幸的是，它不断返回JavaScript...

来自于 2024-04-06 14:54:03

0

2

421

使用'折叠显示”类自定义 Bootstrap 手风琴标题的外观我想设置具有类collapseshow的面板的卡标题样式。在此示例中，它是第一个面板。我尝试使用CSS来使用.accordion.card.card-headerbutton.bt...

来自于 2024-04-06 12:53:11

0

1

376

相关专题

更多>

热门推荐

热门教程

更多>

相关教程

热门推荐

最新课程

最新ThinkPHP 5.1全球首发视频教程(60天成就PHP大牛线上培训班课)

1423365
php入门教程之一周学会PHP

4268908
JAVA 初级入门视频教程

2537444
小甲鱼零基础入门学习Python视频教程

507504
PHP 零基础入门教程

862848

最新下载

更多>

网站特效

网站源码

网站素材

前端模板