팁 | Python 크롤러 도구 Selenium 입문부터 고급까지-파이썬 튜토리얼-php.cn

selenium是最广泛使用的开源Web UI自动化测试套件之一，它所支持的语言包括C++、Java、Perl、PHP、Python和Ruby，在数据抓取方面也是一把利器，能够解决大部分网页的反爬措施，当然它也并非是万能的，一个比较明显的一点就在于是它速度比较慢，如果每天数据采集的量并不是很高，倒是可以使用这个框架。

那么说到安装，可以直接使用pip

셀레늄 는 가장 널리 사용되는 오픈 소스 웹 UI 자동화 테스트 모음 중 하나입니다. 지원되는 언어에는 <code style="font-size: 14px;padding: 2px 4px;border-radius: 4px;margin-right" : rgba mono consolas monaco menlo monospace break-all rgb>C++

, Java,

Perl、<code style="font-size: 14px;padding: 2px 4px;border-radius: 4px;margin-right: 2px;margin-left: 2px; background-color: rgba(27, 31, 35, 0.05 );font-family: " operator mono consolas monaco menlo monospace break-all rgb>PHP

、Python 및 Ruby는 또한 데이터 캡처의 강력한 도구이며 대부분의 웹 크롤링 방지 문제를 해결할 수 있습니다. 물론 만병통치약은 아니지만, 상대적으로 느리다는 점은 매일 수집되는 데이터의 양이 그리 높지 않다면 이 프레임워크를 사용할 수 있습니다.

그러므로 설치 시 pip 설치 중

pip install selenium

🎜동시에 브라우저 드라이버도 설치해야 합니다. 브라우저마다 다른 드라이버를 설치해야 합니다. 여기 편집자는 주로 다음 두 가지를 권장합니다🎜

<코드 스타일="글꼴 크기: 14px;패딩: 2px 4px;국경 반경: 4px;마진 오른쪽: 2px;마진 왼쪽: 2px;배경 색상: rgba(27, 31, 35, 0.05 );font-family: "Operator Mono", Consolas, Monaco, Menlo, monospace;word-break: break-all;color: rgb(150, 84, 181);">Firefox浏览器驱动: < 코드 스타일="글꼴 크기: 14px; 패딩: 2px 4px; 테두리 반경: 4px; 여백 오른쪽: 2px; 여백 왼쪽: 2px; 배경 색상: rgba(27, 31, 35, 0.05); 글꼴- 가족: "Operator Mono", Consolas, Monaco, Menlo, monospace;word-break: break-all;color: rgb(150, 84, 181);">geckodriverFirefox浏览器驱动: geckodriver
Chrome浏览器驱动: chromedriver

小编平常使用的是selenium+chromedriver比较多，所以这里就以Chrome浏览器为示例，由于要涉及到chromedriver的版本需要和浏览器的版本一致，因此我们先来确认一下浏览器的版本是多少？看下图

팁 | Python 크롤러 도구 Selenium 입문부터 고급까지

我们在“关于Chrome”当中找到浏览器的版本，然后下载对应版本的chromedriver

Chrome浏览器驱动: chromedriver

작은 평형 常使용 是셀레늄+chromedriver 더 많은 정보, 所以这里就以Chrome浏览器为示例，由于要涉及到chromedriver의 고유한 특별함과 浏览器的版本一致，因此我们先来确认一下浏览器版本是多少?看下图

팁 | Python 크롤러 도구 Selenium 입문부터 고급까지

🎜

🎜🎜🎜<섹션 스타일="글꼴 크기" : 16px;padding-top: 8px;padding-bottom: 8px;color: 검정;여백: 1em 4px;line-height: 2em;">저는 “关于Chrome”当中找到浏览器的版本，然后下载对应版本的chromedriver ，当然也要对应自己电脑的操作系统🎜🎜🎜🎜🎜🎜

페이지 요소 위치 지정

페이지 요소 위치 지정에 대해 이야기할 때 편집자는 독자가 HTML，CSSetc.

와 같은 가장 기본적인 프런트 엔드 지식을 가지고 있다고 가정합니다.

ID标签的定位

在HTML当中，ID属性是唯一标识一个元素的属性，因此在selenium当中，通过ID来进行元素的定位也作为首选，我们以百度首页为例，搜索框的HTML代码如下，其ID为“kw”，而“百度一下”这个按钮的ID为“su”，我们用Python脚本通过ID的标签来进行元素的定位

driver.find_element_by_id("kw")
driver.find_element_by_id("su")

NAME标签的定位

在HTML当中，Name属性和ID属性的功能基本相同，只是Name属性并不是唯一的，如果遇到没有ID标签的时候，我们可以考虑通过Name标签来进行定位，代码如下

driver.find_element_by_name("wd")

Xpath定位

使用Xpath方式来定位几乎涵盖了页面上的任意元素，那什么是Xpath呢？Xpath是一种在XML和HTML文档中查找信息的语言，当然通过Xpath路径来定位元素的时候也是分绝对路径和相对路径。

绝对路径是以单号/来表示，相对路径是以//来表示，而涉及到Xpath路径的编写，小编这里偷个懒，直接选择复制/粘贴的方式，例如针对下面的HTML代码

<!DOCTYPE html>
<html lang="en">
<head>
    <meta charset="UTF-8">
    <title>Test</title>
</head>
<body>
<form id="loginForm">
    <input name="username" type="text" />
    <input name="password" type="password" />
    <input name="continue" type="submit" value="Login" />
    <input name="continue" type="button" value="Clear" />
</form>

</body>
</html>

我们可以这么来做，打开浏览器的开发者工具，鼠标移到我们选中的元素，然后右击检查，具体看下图

팁 | Python 크롤러 도구 Selenium 입문부터 고급까지

我们还是以百度首页为例，看一下如何通过Xpath来进行页面元素的定位，代码如下

driver.find_element_by_xpath(&#39;//*[@id="kw"]&#39;)

className标签定位

我们也可以基于class属性来定位元素，尤其是当我们看到有多个并列的元素如list表单，class用的都是共用同一个，如：

driver.find_element_by_class_name("classname")

这个时候，我们就可以通过class属性来定位元素，该方法返回的是一个list列表，而当我们想要定位列表当中的第n个元素时，则可以这样来安排

driver.find_elements_by_class_name("classname")[n]

需要注意的是，这里使用的是find_elements_by_class_name()方法而不是find_element_by_class_name()方法，这里我们还是通过百度首页的例子，通过className标签来定位搜索框这个元素

driver.find_element_by_class_name(&#39;s_ipt&#39;)

`CssSelector()`方法定位

其实在Selenium官网当中是更加推荐CssSelector()方法来进行页面元素的定位的，原因在于相比较于Xpath定位速度更快，Css定位分为四类：ID值、Class属性、TagName值等等，我们依次来看

ID方式来定位

大概有两种方式，一种是在ID值前面添加TagName的值，另外一种则是不加，代码如下

driver.find_element_by_css_selector("#id_value")  # 不添加前面的`TagName`值
driver.find_element_by_css_selector("tag_name.class_value")  # 不添加前面的`TagName`值

当然有时候这个TagName的值非常的冗长，中间可能还有空格，那么这当中的空格就需要用点“.”来替换

driver.find_element_by_css_selector("tag_name.class_value1.calss_value2.class_value3")  # 不添加前面的`TagName`值

我们仍然以百度首页的搜索框为例，它的HTML代码如下

팁 | Python 크롤러 도구 Selenium 입문부터 고급까지

要是用CssSelector的.class()方式来实现元素的定位的话，Python代码该这样来实现，和上面Xpath()的方法一样，可以稍微偷点懒，通过复制/粘贴的方式从开发者工具当中来获取元素的位置

팁 | Python 크롤러 도구 Selenium 입문부터 고급까지

代码如下

driver.find_element_by_css_selector(&#39;#kw&#39;)

linkText()方式来定位

这个方法直接通过链接上面的文字来定位元素，案例如下

팁 | Python 크롤러 도구 Selenium 입문부터 고급까지

通过linkText()方法来定位“地图”这个元素，代码如下

driver.find_element_by_link_text("地图").click()

浏览器的控制

修改浏览器窗口的大小

我们可以通过使用set_window_size()这个方法来修改浏览器窗口的大小，代码如下

# 修改浏览器的大小
driver.set_window_size(500, 900)

同时还有maxmize_window()方法是用来实现浏览器全屏显示，代码如下

# 全屏显示
driver.maximize_window()

浏览器的前进与后退

前进与后退用到的方法分别是forward()和back()，代码如下

# 前进与后退
driver.forward()
driver.back()

浏览器的刷新

刷新用到的方法是refresh()，代码如下

# 刷新页面
driver.refresh()

除了上面这些，webdriver的常见操作还有

关闭浏览器：get()
清除文本：clear()
单击元素：click()
提交表单：submit()
模拟输入内容：send_keys()

我们可以尝试着用上面提到的一些方法来写段程序

from selenium import webdriver
from time import sleep

driver = webdriver.Chrome(executable_path="chromedriver.exe")
driver.get("https://www.baidu.com")
sleep(3)
driver.maximize_window()
sleep(1)
driver.find_element_by_xpath(&#39;//*[@id="s-top-loginbtn"]&#39;).click()
sleep(3)
driver.find_element_by_xpath(&#39;//*[@id="TANGRAM__PSP_11__userName"]&#39;).send_keys(&#39;12121212&#39;)
sleep(1)
driver.find_element_by_xpath(&#39;//*[@id="TANGRAM__PSP_11__password"]&#39;).send_keys(&#39;testtest&#39;)
sleep(2)
driver.refresh()
sleep(3)
driver.quit()

output

팁 | Python 크롤러 도구 Selenium 입문부터 고급까지

鼠标的控制

鼠标的控制都是封装在ActionChains类当中，常见的有以下几种

引入action_chains类
from selenium.webdriver.common.action_chains import ActionChains
# 右击
ActionChains(driver).context_click(element).perform()
# 双击
ActionChains(driver).double_click(element).perform()
# 拖放
ActionChains(driver).drag_and_drop(Start, End).perform()
# 悬停
ActionChains(driver).move_to_element(Above).perform()
# 按下
ActionChains(driver).click_and_hold(leftclick).perform()
# 执行指定的操作

键盘的控制

webdriver中的Keys()类，提供了几乎所有按键的方法，常用的如下

# 删除键
driver.find_element_by_id(&#39;xxx&#39;).send_keys(Keys.BACK_SPACE)
# 空格键
driver.find_element_by_id(&#39;xxx&#39;).send_keys(Keys.SPACE)
# 回车键
driver.find_element_by_id(&#39;xxx&#39;).send_keys(Keys.ENTER)
# Ctrl + A 全选内容
driver.find_element_by_id(&#39;xxx&#39;).send_keys(Keys.CONTROL, &#39;a&#39;)
# Ctrl + C/V 复制/粘贴内容
driver.find_element_by_id(&#39;xxx&#39;).send_keys(Keys.CONTROL, &#39;c&#39;)
driver.find_element_by_id(&#39;xxx&#39;).send_keys(Keys.CONTROL, &#39;v&#39;)

其他的一些键盘操作

向上箭头：Keys.ARROW_UP
向下箭头：Keys.ARROW_DOWN
向左/向右箭头：Keys.ARROW_LEFT/Keys.ARROW_RIGHT
Shift键：Keys.SHIFT
F1键：Keys.F1

元素的等待

有显示等待和隐式等待两种

显示等待

显示等待指的是设置一个超时时间，每隔一段时间去查看一下该元素是否存在，如果存在则执行后面的内容，要是超过了最长的等待时间，则抛出异常(TimeoutException)，需要用到的是WebDriverWait()方法，同时配合until和not until方法

WebDriverWait(driver, timeout, poll_frequency=0.5, ignored_exceptions=None)

其中的参数：

timeout: 最长超时时间，默认以秒为单位
poll_frequency: 检测的时间间隔，默认是0.5s
ignored_exceptions: 指定忽略的异常，默认忽略的有NoSuchElementException这个异常

我们来看下面的案例

driver = webdriver.Chrome()
driver.get("http://somedomain/url_that_delays_loading")
try:    
    element = WebDriverWait(driver, 10).until(           
        EC.presence_of_element_located((By.ID, "myDynamicElement")))
finally:    
    driver.quit()

上面的代码最多等待10秒，超时后就抛出异常，但是假设在等了3秒之后就找到了这个元素，那么也就不会多等下剩下的7秒钟时间，而是继续执行后续的代码

隐式等待

主要使用的是implicitly_wait()来实现

browser = webdriver.Chrome(path)
# 隐式等待3秒
browser.implicitly_wait(3)

获取`Cookie`

Cookie是用来识别用户身份的关键，我们通常也是通过selenium先模拟登录网页获取Cookie，然后再通过requests携带Cookie来发送请求。

webdriver提供了cookies的几种操作，我们挑选几个常用的来说明

get_cookies()：以字典的形式返回当前会话中可见的cookie信息
get_cookies(name): 返回cookie字典中指定的的cookie信息
add_cookie(cookie_dict): 将cookie添加到当前会话中

下面看一个简单的示例代码

driver=webdriver.Chrome(executable_path="chromedriver.exe")
driver.get(url=url)
time.sleep(1)

cookie_list=driver.get_cookies()
cookies =";".join([item["name"] +"=" + item["value"] + "" for item in cookie_list])
session=requests.session()

headers = {
    &#39;User-Agent&#39;:&#39;Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/83.0.4103.106 Safari/537.36&#39;,
    &#39;cookie&#39;: cookies
}

response=session.get(url=url,headers=headers)
soup=BeautifulSoup(response.text,&#39;lxml&#39;)

调用`JavaScript`

在webdriver当中可以使用execut_script()方法来实现JavaScript的执行，下面我们来看一个简单的例子

from selenium import webdriver
import time
bro=webdriver.Chrome(executable_path=&#39;./chromedriver&#39;)
bro.get("https://www.baidu.com")

# 执行js代码
bro.execute_script(&#39;alert(10)&#39;)
time.sleep(3)
bro.close()

除此之外，我们还可以通过selenium执行JavaScript来实现屏幕上下滚动

from selenium import webdriver
bro=webdriver.Chrome(executable_path=&#39;./chromedriver&#39;)
bro.get("https://www.baidu.com")
# 执行js代码
bro.execute_script(&#39;window.scrollTo(0,document.body.scrollHeight)&#39;)

`selenium`进阶

selenium启动的浏览器，会非常容易的被检测出来，通常可以通过window.navigator.webdriver的值来查看，如果是true则说明是使用了selenium模拟浏览器，如果是undefined则通常会被认为是正常的浏览器。

那么我们似乎可以执行下面这段代码来强行更改window.navigator.webdriver最后返回的值

driver.execute_script(
    &#39;Object.defineProperties(navigator,{webdriver:{get:()=>false}})&#39;
)

当然这种方法也有一定的缺陷，毕竟这段代码是在网页已经加载完毕之后才运行的，此时网页自身的JavaScript程序已经通过读取window.navigator.webdriver知道你使用的是模拟浏览器了。所以我们有两种办法来解决这个缺陷。

在Chrome当中添加实验性功能参数

代码如下

from selenium.webdriver import Chrome
from selenium.webdriver import ChromeOptions

option = ChromeOptions()
option.add_experimental_option(&#39;excludeSwitches&#39;,[&#39;enable-automation&#39;])
driver=Chrome(options=option)

调用chrome当中的开发工具协议的命令

核心思想就是让Chrome浏览器在打开页面，还没有运行网页自带的JavaScript代码时，先来执行我们给定的代码，通过execute_cdp_cmd()方法，

driver.execute_cdp_cmd("Page.addScriptToEvaluateOnNewDocument", {
    "source": """
        Object.defineProperty(navigator, &#39;webdriver&#39;, {
            get: () => undefined
        })
    """
})

当然为了更好隐藏指纹特征，我们可以将上面两种方法想结合

from selenium import webdriver
options = webdriver.ChromeOptions()
options.add_experimental_option("excludeSwitches", ["enable-automation"])
options.add_experimental_option(&#39;useAutomationExtension&#39;, False)
driver = webdriver.Chrome(options=options, executable_path=&#39;./chromedriver&#39;)
driver.execute_cdp_cmd("Page.addScriptToEvaluateOnNewDocument", {
  "source": """
    Object.defineProperty(navigator, &#39;webdriver&#39;, {
      get: () => undefined
    })
  """
})
driver.get(url)

最后的最后，我们也可以通过运行stealth.min.js文件来实现隐藏selenium模拟浏览器的特征，这个文件之前是给puppeteer用的，使得其隐藏浏览器的指纹特征，而让Python使用时，需要先导入这份JS文件

import time
from selenium.webdriver import Chrome

option = webdriver.ChromeOptions()
option.add_argument("--headless")

# 无头浏览器需要添加user-agent来隐藏特征
option.add_argument(&#39;user-agent=.....&#39;)
driver = Chrome(options=option)
driver.implicitly_wait(5)

with open(&#39;stealth.min.js&#39;) as f:
    js = f.read()

driver.execute_cdp_cmd("Page.addScriptToEvaluateOnNewDocument", {
  "source": js
})

driver.get(url)

위 내용은 팁 | Python 크롤러 도구 Selenium 입문부터 고급까지의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

본 웹사이트의 성명

핫 AI 도구

Video Face Swap

완전히 무료인 AI 얼굴 교환 도구를 사용하여 모든 비디오의 얼굴을 쉽게 바꾸세요!

뜨거운 도구

뜨거운 주제

PHP 튜토리얼

1596

276

Related knowledge

숭고한 텍스트로 Python 코드를 실행하는 방법은 무엇입니까? Aug 16, 2025 am 04:58 AM

Python이 설치되어 시스템 경로에 추가되었는지 확인하고 Python (Version 또는 Python3)을 터미널을 통해 실행하십시오. 2. Python 파일을 Hello.py와 같은 .py 확장자로 저장합니다. 3. Sublimetext에서 사용자 정의 빌드 시스템을 작성하고 Windows 사용자는 { "CMD": [ "Python", "-U", "$ File"]}, MacOS/Linux 사용자를 사용합니다. "CMD": [ "Python3

vscode에서 파이썬 스크립트를 디버깅하는 방법 Aug 16, 2025 am 02:53 AM

Python 스크립트를 디버그하려면 먼저 Python 확장자를 설치하고 인터프리터를 구성한 다음 Launch.json 파일을 작성하여 디버깅 구성을 설정 한 다음 코드에서 중단 점을 설정하고 F5를 눌러 디버깅을 시작하십시오. 스크립트는 중단 점에서 일시 중지되어 변수를 확인하고 단계별 실행을 허용합니다. 마지막으로, 콘솔 출력을 보거나 로그를 추가하거나 매개 변수를 조정하여 문제를 확인하여 환경이 올바른 후 디버깅 프로세스가 간단하고 효율적인지 확인합니다.

파이썬의 클래스 방법은 무엇입니까? Aug 21, 2025 am 04:12 AM

ClassMethodsInpyThonareBoundTotheClassandNottoinStances

Python asyncio 대기열 예제 Aug 21, 2025 am 02:13 AM

asyncio.queue는 비동기 작업 간의 안전한 통신을위한 큐 도구입니다. 1. 생산자는 awaitqueue.put (항목)을 통해 데이터를 추가하고 소비자는 awaitqueue.get ()를 사용하여 데이터를 얻습니다. 2. 처리하는 각 항목의 경우 queue.task_done ()을 호출하여 모든 작업을 완료하려면 queue.join ()을 기다려야합니다. 3. 소비자가 중지하도록 통지하기 위해 최종 신호로 아무것도 사용하지 않습니다. 4. 여러 소비자 인 경우 작업을 취소하기 전에 다수의 종말 신호를 보내거나 모든 작업이 처리되었습니다. 5. 큐는 설정 최대 규모의 제한 용량을 지원하고, 작업을 자동으로 매달아주고 이벤트 루프를 차단하지 않으며, 프로그램이 마침내 칸치를 통과합니다.

Python에서 수율 키워드는 어떻게 작동합니까? Aug 15, 2025 am 08:23 AM

수율 키워드는 생성기 함수를 정의하는 데 사용되므로 실행 및 리턴 값을 하나씩 일시 중지 한 다음 일시 중지에서 복구 할 수 있습니다. 생성기 함수는 생성기 객체를 반환하고 게으른 평가 특성을 가지고 있으며 메모리를 저장할 수 있습니다. 큰 파일, 스트리밍 데이터 및 무한 시퀀스와 같은 시나리오를 처리하는 데 적합합니다. 발전기는 다음 () 및 루프를 지원하는 반복기이지만 되감기는 아니며 다시 반복하려면 재현해야합니다.

숭고한 텍스트로 파이썬 프로젝트를 만드는 방법은 무엇입니까? Aug 16, 2025 am 08:53 AM

installSublimetextandpython, thenconfigureaBuildsystembycreatingapython33.sublime-buildfilewithTheAppropriateCmdEctOrsetStoTtingStoEnablerUnningPyThonScriptSviactrl B.OrganizeInizeYourgepppertyThileStpyThileStpytpliessOpportingdocument

파이썬 스크립트를 실행하고 숭고한 텍스트의 별도 패널에서 출력을 보는 방법은 무엇입니까? Aug 17, 2025 am 06:06 AM

toseepythonoutputinaseparatepanelinsublimetext, usethebuilt-inbuildsystembysavingyourfilewitha.pyextensionandpressingctrl b (orcmd b) .2.ensurethecorrectBuildSystecelectedBygrowingTotools → BuildSystem → Pythonandconfirmon "

파이썬으로 웹을 긁는 동안 차단되지 않는 방법은 무엇입니까? Aug 16, 2025 am 09:54 AM

ToaVoidgetTingBlocked WhileweBsplocked, userEalisticRequestHeaders, addrandomizedDelays, RotateIpAddresswithProxies, MaintureSessions, respectrobots.txt 및 useheadlessbrowserswhendecessary, enveringalandaldealthybehaviortomicrealussand

See all articles

팁 | Python 크롤러 도구 Selenium 입문부터 고급까지

`셀레늄`소개 및 설치`selenium`的简介与安装

페이지 요소 위치 지정

ID标签的定位

NAME标签的定位

Xpath定位

className标签定位

`CssSelector()`方法定位

linkText()方式来定位

浏览器的控制

修改浏览器窗口的大小

浏览器的前进与后退

浏览器的刷新

鼠标的控制

键盘的控制

元素的等待

显示等待

隐式等待

调用`JavaScript`

`selenium`进阶

핫 AI 도구

Undress AI Tool

Undresser.AI Undress

AI Clothes Remover

Clothoff.io

Video Face Swap

인기 기사

뜨거운 도구

메모장++7.3.1

SublimeText3 중국어 버전

스튜디오 13.0.1 보내기

드림위버 CS6

SublimeText3 Mac 버전

뜨거운 주제

팁 | Python 크롤러 도구 Selenium 입문부터 고급까지

셀레늄소개 및 설치selenium的简介与安装

페이지 요소 위치 지정

ID标签的定位

NAME标签的定位

Xpath定位

className标签定位

CssSelector()方法定位

linkText()方式来定位

浏览器的控制

修改浏览器窗口的大小

浏览器的前进与后退

浏览器的刷新

鼠标的控制

键盘的控制

元素的等待

显示等待

隐式等待

获取Cookie

调用JavaScript

selenium进阶

핫 AI 도구

Undress AI Tool

Undresser.AI Undress

AI Clothes Remover

Clothoff.io

Video Face Swap

인기 기사

뜨거운 도구

메모장++7.3.1

SublimeText3 중국어 버전

스튜디오 13.0.1 보내기

드림위버 CS6

SublimeText3 Mac 버전

뜨거운 주제

`셀레늄`소개 및 설치`selenium`的简介与安装

`CssSelector()`方法定位

获取`Cookie`

调用`JavaScript`

`selenium`进阶