Python怎么爬虫淘宝商品数据-Python教程-PHP中文网

Python怎么爬虫淘宝商品数据

尚2019-07-08 09:13:46原创

这次的主要的目的是从淘宝的搜索页面获取商品的信息。其实分析页面找到信息很容易，页面信息的存放都是以静态的方式直接嵌套的页面上的，很容易找到。主要困难是将信息从HTML源码中剥离出来，数据和网页源码结合的很紧密，剥离数据有一定的难度。

然后将获取的信息写入excel表格保存起来，这次只爬取了前面10页的内容。

代码如下：

import requests
import re
from xlwt import Workbook
import xlrd
import time
def key_name( number ):
    #获取页面的内容并返回
    name = '手机'
    URL_1 = "https://s.taobao.com/search?ie=utf8&initiative_id=staobaoz_20170905&stats_click=search_radio_all%3A1&js=1&imgfile=&q="
    URL_2 = "&suggest=0_1&_input_charset=utf-8&wq=u&suggest_query=u&source=suggest&p4ppushleft=5%2C48&s="
    URL = ( URL_1 + name + URL_2 + str(number))
    #print(URL)
    res = requests.get( URL )
    return res.text
def find_date( text):
    #根据整个页面的信息，获取商品的数据所在的HTML源码并放回
    reg = r',"data":{"spus":\[({.+?)\]}},"header":'
    reg = re.compile(reg)
    info = re.findall(reg, text)
    return info[0]
def manipulation_data( info, N, sheet ):
    #解析获取的HTML源码，获取数据
    Date = eval(info)
    for d in Date:
        T = " ".join([t['tag'] for t in d['tag_info']])
        #print(d['title'] + '\t' + d['price'] + '\t' + d['importantKey'][0:len(d['importantKey'])-1] + '\t' + T)
        
        sheet.write(N,0,d['title'])
        sheet.write(N,1,d['price'])
        sheet.write(N,2,T)
        N = N + 1
    return N
    
    
def main():
    
    book = Workbook()
    sheet = book.add_sheet('淘宝手机数据')
    sheet.write(0,0,'品牌')
    sheet.write(0,1,'价格')
    sheet.write(0,2,'配置')
    book.save('淘宝手机数据.xls')
    #k用于生成链接，每个链接的最后面的数字相差48.
    #N用于记录表格的数据行数，便于写入数据
    k = 0
    N = 1
    for i in range(10+1):
        text = key_name( k + i * 48 )
        info = find_date(text)
        N = manipulation_data( info ,N, sheet )
    
        book.save('淘宝手机数据.xls')
        print('下载第' + str(i) + '页完成')
if __name__ == '__main__':
    main()

更多Python相关技术文章，请访问Python教程栏目进行学习！

以上就是Python怎么爬虫淘宝商品数据的详细内容，更多请关注php中文网其它相关文章！

声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn核实处理。

专题推荐：Python怎么爬虫淘宝数据

上一篇：python中怎么实现倒三角的打印下一篇：python爬虫怎么写

小甲鱼零基础入门学习Python视频教程

《小甲鱼零基础入门学习Python视频基础》讲的是Python开发的入门教程，它将介绍Python语言的特点和适用范围，Python基本的数据类型，条件判断和循环，函数，以及Python特有的切片和列表生成式。希望本python教程能够让您快速入门并编写简单的Python程序。

黑马云课堂8天深入理解Python视频教程

Python, 是一种面向对象、解释型计算机程序设计语言，由Guido van Rossum于1989年发明，第一个公开发行版发行于1991年。 Python是纯粹的自由软件，源代码和解释器CPython遵循 GPL(GNU General Public License)协议。 Python语法简洁清晰，特色之一是强制用空白符(white space)作为语句缩进。 Python具有丰富和强大的库。它常被昵称为胶水语言，能够把用其他语言制作的各种模块（尤其是C/C++）很轻松地联结在一起。《黑马云课堂8天深入理解Python视频教程》带你深入理解Python语言

零基础入门Python项目实战

新手往往会不知道从哪下手去做项目，缺乏编程思路和经验，不知道哪个库应该用来解决什么问题。而项目训练体系最大的价值在于，把这些新手必备的编程思路、经验知识、语法知识拆解到多个项目里。本课程让你对 Python 的用法有一个全局的认识，在使用中熟悉常用 Python库，并且养成编程思路。

Python怎么爬虫淘宝商品数据

相关文章推荐

相关课程推荐

小甲鱼零基础入门学习Python视频教程

黑马云课堂8天深入理解Python视频教程

Python实战爬虫视频教程

Python Scrapy 网络爬虫实战视频教程

零基础入门Python项目实战

PHP中文网