Web scraping avec des proxys : bonnes pratiques, limites et aspects juridiques
Publié le · 4 min de lecture
Suivre des prix, des disponibilités ou des résultats de recherche fait partie du quotidien des équipes e-commerce et des analystes. Bien le faire, c'est obtenir des données fiables sans surcharger les sites et en respectant les règles. Les proxys ne sont qu'une pièce du puzzle.
Avant de commencer : existe-t-il plus simple ?
Beaucoup de sites proposent des API, des flux produits ou des exports de données. Ils sont plus stables que le scraping, ne cassent pas à chaque refonte et précisent ce que vous pouvez faire des données. Le scraping a du sens quand il n'y a pas d'alternative ou qu'elle ne couvre pas vos besoins.
Les aspects juridiques à connaître
Ce n'est pas un conseil juridique, mais certains points s'appliquent presque partout :
- Données personnelles : en Europe, le RGPD s'applique aussi aux données publiées en ligne. Noms, e-mails, photos et profils de personnes exigent une base légale et des garanties spécifiques. Si possible, évitez de les collecter.
- Conditions d'utilisation : beaucoup de sites encadrent explicitement le scraping. Les enfreindre peut avoir des conséquences contractuelles.
- Droit d'auteur et droit des bases de données : copier et republier des contenus ou des bases entières peut porter atteinte aux droits du titulaire.
- Zones protégées : ne collectez pas de données situées derrière une connexion ou des contrôles d'accès sans autorisation.
Quand il faut des proxys
- Contenus locaux : prix, disponibilités et résultats de recherche changent selon le pays. Avec une IP italienne, néerlandaise, britannique ou française, vous voyez ce que voit un utilisateur local.
- Version mobile : avec un proxy mobile, vous voyez les contenus comme un utilisateur de smartphone sur le réseau d'un opérateur.
- Répartir la charge : beaucoup de requêtes depuis une seule IP finissent limitées, même si le rythme global est raisonnable.
Le type de proxy à choisir dépend du volume et des sites visés : voir Proxys mobiles, résidentiels et datacenter.
Bonnes pratiques techniques
- Respectez robots.txt et les éventuelles indications de fréquence d'exploration.
- Allez doucement : quelques requêtes par seconde, avec des pauses variables. Le rythme se remarque plus que l'IP.
- Mettez en cache les pages qui changent peu et ne téléchargez que ce dont vous avez besoin.
- Gérez les erreurs : en cas de 429 (trop de requêtes) ou de 503, attendez, en allongeant la pause à chaque tentative.
- Faites tourner l'IP avec discernement : à intervalles ou quand un site commence à vous limiter, pas à chaque requête. Voir Rotation d'IP.
- Utilisez des en-têtes réalistes et cohérents (user agent, langue).
- Travaillez aux heures creuses du site quand c'est possible.
Exemple en Python
Un squelette avec pauses, nouvelles tentatives et rotation de l'IP quand le site répond par une limite :
import random, time, requests
PROXY = "http://IDENTIFIANT:MOT_DE_PASSE@HOTE:PORT"
ROTATE = "LIEN_DE_ROTATION"
session = requests.Session()
session.proxies = {"http": PROXY, "https": PROXY}
def fetch(url, tries=4):
for attempt in range(tries):
r = session.get(url, timeout=30)
if r.status_code == 200:
return r.text
if r.status_code in (429, 503):
requests.get(ROTATE, timeout=30) # nouvelle IP
time.sleep(30 + 2 ** attempt) # attente croissante
continue
r.raise_for_status()
raise RuntimeError(f"Trop de tentatives : {url}")
for url in ["https://example.com/a", "https://example.com/b"]:
html = fetch(url)
time.sleep(random.uniform(2, 5)) # rythme humainLa configuration du proxy en Python et Node.js est détaillée dans les guides Python et Node.js.
Avec un navigateur automatisé
Les sites qui chargent leurs contenus en JavaScript nécessitent un navigateur automatisé (Playwright, Puppeteer, Selenium). Les mêmes règles s'appliquent, avec une attention accrue à la cohérence : langue, fuseau horaire et système d'exploitation du navigateur doivent correspondre au proxy, y compris l'empreinte TCP/IP.
Questions fréquentes
Le web scraping est-il légal ?
Collecter des données publiques n'est pas illégal en soi, mais cela dépend des données collectées, de leur usage et des conditions du site. Les données personnelles relèvent du RGPD. Pour les projets importants, prenez conseil auprès d'un juriste.
Combien de requêtes puis-je faire avec un proxy mobile ?
Chez ProxyHub, le trafic est illimité, mais la vraie limite est fixée par le site : gardez un rythme raisonnable et étalez la charge dans le temps.
Un proxy mobile vaut-il le coup pour le scraping ?
Oui, si vous avez besoin de contenus mobiles ou locaux fiables et de sites aux filtres stricts. Pour de gros volumes sur des sites sans filtres, un proxy datacenter peut suffire.
Essayez un proxy mobile 5G
Smartphone dédié, trafic illimité, vraies IP d'opérateurs. Actif en quelques minutes.
Voir les offres