>  기사  >  백엔드 개발  >  Python 크롤러 비디오 크롤링에 대한 자세한 소개

Python 크롤러 비디오 크롤링에 대한 자세한 소개

不言
不言원래의
2018-09-19 17:27:2022360검색

이 기사는 Python 크롤러 비디오 크롤링에 대한 자세한 소개를 제공합니다. 도움이 필요한 친구들이 참고할 수 있기를 바랍니다.

최근에 신청서를 작성하고 있는데 Weibo에서 인기 있는 동영상을 수집해야 합니다. 이 짧은 동영상은 대개 Miaopai, Weipai, Meipai 및 Sina Video에서 제공되며 다운로드 옵션이 없어서 두뇌만 사용할 수 있습니다. 방법을 생각해 보세요.

첫 번째 단계

웹페이지의 소스 코드를 분석합니다. 예: http://video.weibo.com/show?fid=1034:0988e59a12e5178acb7f23adc3fe5e97, 소스 코드를 보려면 마우스 오른쪽 버튼을 클릭하세요. 일반적으로 동영상에는 mp4 접미사가 붙습니다. 검색하면 찾을 수 없지만 일부는 찾을 수 없습니다. 메이파이 영상 등을 직접 볼 수 있습니다.

2단계

패킷을 캡처하고 요청을 분석한 후 반환합니다. 이는 강력한 크롬을 통해서도 가능하며, 위의 예에서 마우스 오른쪽 버튼 클릭->요소 검사->NetWork를 누른 다음 F5로 웹페이지를 새로 고칩니다.
Python 크롤러 비디오 크롤링에 대한 자세한 소개

요청이 많아서 분석만 할 수 있습니다. 실제로 동영상 형식은 mp4, flv, avi 등을 한 번에 볼 수 있으며, 당연히 우리가 원하는 다운로드 링크입니다.
Python 크롤러 비디오 크롤링에 대한 자세한 소개

3단계

다운로드 링크와 동영상 링크의 패턴을 분석합니다. 즉, http://video.weibo.com/show?fid=1034:0988e59a12e5178acb7f23adc3fe5e97과 xxx.mp4 사이의 관계입니다. 이를 위해서는 다시 웹페이지 소스 코드를 분석해야 합니다. 실제로 위의 .m3u8 접미사가 있는 링크에 주의할 수 있습니다. m3u8은 인덱스 일반 텍스트 파일을 열 때 재생하지 않지만 찾습니다. 해당 파일의 네트워크 주소를 사용하여 온라인으로 재생하고 열고 원하는 다운로드 링크가 실제로 기록되어 있는지 확인하세요. 또한 .m3u8 접미사가 붙은 링크는 웹 페이지의 소스 코드에 있습니다.
Python 크롤러 비디오 크롤링에 대한 자세한 소개

요약

처음 세 단계를 분석한 후, 동영상 다운로드 링크를 얻는 아이디어는 먼저 웹 페이지 소스 코드에서 .m3u8 접미사가 붙은 링크를 얻고, 파일을 다운로드하고, 그것으로부터 비디오 다운로드 링크를 얻고, 마지막으로 비디오를 다운로드하세요.

소스 코드

#sinavideo.py
#coding=utf-8
import os
import re
import urllib2
import urllib 
from common import Common
class SinaVideo():

    URL_PIRFIX = "http://us.sinaimg.cn/"
    def getM3u8(self,html):
        reg = re.compile(r'list=([\s\S]*?)&fid')
        result = reg.findall(html)
        return result[0]


    def getName(self,url):
         return url.split('=')[1]

    def getSinavideoUrl(self,filepath):
        f = open(filepath,'r')
        lines = f.readlines()
        f.close()
        for line in lines:
            if line[0] !='#':
                return line

    def download(self,url,filepath):
        #获取名称
        name = self.getName(url)
        html = Common.getHtml(url)
        m3u8 = self.getM3u8(html)
        Common.download(urllib.unquote(m3u8),filepath,name + '.m3u8')
        url = self.URL_PIRFIX + self.getSinavideoUrl(filepath+name+'.m3u8')
        Common.download(url,filepath,name+'.mp4')
#common.py
#coding=utf-8
import urllib2
import os
import re


class Common():
    #  获取网页源码
    @staticmethod
    def getHtml(url):
        html = urllib2.urlopen(url).read()
        print  "[+]获取网页源码:"+url
        return html

    # 下载文件
    @staticmethod
    def download(url,filepath,filename):
        headers = {
            'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',
            'Accept-Charset': 'UTF-8,*;q=0.5',
            'Accept-Encoding': 'gzip,deflate,sdch',
            'Accept-Language': 'en-US,en;q=0.8',
            'User-Agent': 'Mozilla/5.0 (Linux; Android 4.4.2; Nexus 4 Build/KOT49H) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/34.0.1847.114 Mobile Safari/537.36'
        }
        request = urllib2.Request(url,headers = headers);
        response = urllib2.urlopen(request)
        path = filepath + filename
        with open(path,'wb') as output:
            while True:
                buffer = response.read(1024*256);
                if not buffer:
                    break
                # received += len(buffer)
                output.write(buffer)

        print "[+]下载文件成功:"+path

    @staticmethod
    def isExist(filepath):
        return os.path.exists(filepath)

    @staticmethod
    def createDir(filepath):
         os.makedirs(filepath,0777)

호출 방법:

 url = "http://video.weibo.com/show?fid=1034:0988e59a12e5178acb7f23adc3fe5e97"sinavideo = SinaVideo()         
 sinavideo.download(url,""/Users/cheng/Documents/PyScript/res/"")

Result

Python 크롤러 비디오 크롤링에 대한 자세한 소개

위 내용은 Python 크롤러 비디오 크롤링에 대한 자세한 소개의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

성명:
본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.