Faux visites de navigateur avec les requêtes et les agents utilisateurs de Python : une solution aux blocages de sites Web
Lorsque vous accédez à des sites Web à l'aide du package Requests de Python, vous pouvez rencontrer situations où le contenu HTML obtenu diffère considérablement de celui affiché dans un navigateur. Cela est souvent dû au fait que le site Web utilise des blocages qui identifient et restreignent l'accès aux non-navigateurs.
Pour surmonter ce problème, vous pouvez simuler les visites du navigateur en fournissant un en-tête User-Agent, qui identifie le type de navigateur et son fonctionnement. système utilisé. Cela permet au site Web de croire qu'il s'agit d'une véritable visite du navigateur, donnant accès au contenu souhaité. Voici comment procéder avec les requêtes :
import requests url = 'http://www.ichangtou.com/#company:data_000008.html' headers = {'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/39.0.2171.95 Safari/537.36'} response = requests.get(url, headers=headers) print(response.content)
Alternativement, le package fake-useragent fournit un moyen pratique de générer et d'utiliser des agents utilisateurs pour différents navigateurs :
from fake_useragent import UserAgent ua = UserAgent() random_ua = ua.random headers = {'User-Agent': random_ua} response = requests.get(url, headers=headers)
En utilisant Ces techniques pour simuler les visites du navigateur, vous pouvez accéder avec succès aux sites Web qui bloquaient auparavant vos tentatives basées sur Python.
Ce qui précède est le contenu détaillé de. pour plus d'informations, suivez d'autres articles connexes sur le site Web de PHP en chinois!