Salta al contenuto
ProxyHub

Web scraping con i proxy: buone pratiche, limiti e aspetti legali

Pubblicato il · 3 min di lettura

Monitorare prezzi, disponibilità o risultati di ricerca è un lavoro comune per e-commerce e analisti. Farlo bene significa ottenere dati affidabili senza sovraccaricare i siti e restando nelle regole. I proxy sono solo un pezzo del puzzle.

Prima di iniziare: c'è un modo più semplice?

Molti siti offrono API, feed di prodotti o esportazioni di dati. Sono più stabili dello scraping, non si rompono a ogni modifica grafica e chiariscono cosa puoi fare con i dati. Lo scraping ha senso quando non esistono alternative o non coprono quello che ti serve.

Gli aspetti legali da conoscere

Non è un parere legale, ma alcuni punti valgono quasi ovunque:

  • Dati personali: in Europa il GDPR si applica anche ai dati pubblicati online. Nomi, email, foto e profili di persone richiedono una base giuridica e cautele precise. Se puoi, evita del tutto di raccoglierli.
  • Condizioni d'uso: molti siti le regolano esplicitamente. Violarle può avere conseguenze contrattuali.
  • Diritto d'autore e banche dati: copiare e ripubblicare contenuti o intere banche dati può violare i diritti del titolare.
  • Aree protette: non raccogliere dati dietro login o sistemi di accesso senza autorizzazione.
Nel dubbio, chiedi a un legale prima di avviare un progetto di raccolta dati su larga scala.

Quando servono i proxy

  • Contenuti locali: prezzi, disponibilità e risultati di ricerca cambiano da paese a paese. Con un IP italiano, olandese, britannico o francese vedi quello che vede un utente locale.
  • Versione mobile: con un proxy mobile vedi i contenuti come un utente da smartphone sulla rete di un operatore.
  • Distribuire il carico: tante richieste da un solo IP vengono limitate anche quando il ritmo complessivo è ragionevole.

Quale tipo di proxy scegliere dipende da volume e siti: lo spieghiamo in Proxy mobili, residenziali e datacenter.

Buone pratiche tecniche

  1. Rispetta robots.txt e le eventuali indicazioni sul ritmo di accesso.
  2. Vai piano: poche richieste al secondo, con pause variabili. Il ritmo si nota più dell'IP.
  3. Metti in cache le pagine che non cambiano spesso e scarica solo quello che ti serve.
  4. Gestisci gli errori: con 429 (troppe richieste) o 503 aspetta, aumentando l'attesa a ogni tentativo.
  5. Ruota con criterio: a intervalli o quando un sito inizia a limitarti, non a ogni richiesta. Vedi Rotazione IP.
  6. Usa intestazioni realistiche e coerenti tra loro (user agent, lingua).
  7. Lavora negli orari di minor traffico del sito, quando possibile.

Esempio in Python

Uno scheletro con pause, nuovi tentativi e rotazione dell'IP quando il sito risponde con un limite:

Python
import random, time, requests

PROXY = "http://UTENTE:PASSWORD@HOST:PORTA"
ROTATE = "LINK_DI_ROTAZIONE"
session = requests.Session()
session.proxies = {"http": PROXY, "https": PROXY}

def fetch(url, tries=4):
    for attempt in range(tries):
        r = session.get(url, timeout=30)
        if r.status_code == 200:
            return r.text
        if r.status_code in (429, 503):
            requests.get(ROTATE, timeout=30)   # nuovo IP
            time.sleep(30 + 2 ** attempt)      # attesa crescente
            continue
        r.raise_for_status()
    raise RuntimeError(f"Troppi tentativi: {url}")

for url in ["https://example.com/a", "https://example.com/b"]:
    html = fetch(url)
    time.sleep(random.uniform(2, 5))       # ritmo umano

La configurazione dei proxy in Python e Node.js è spiegata nelle guide per Python e Node.js.

Con un browser automatizzato

Per siti che caricano i contenuti con JavaScript serve un browser automatizzato (Playwright, Puppeteer, Selenium). Valgono le stesse regole, con un'attenzione in più alla coerenza: lingua, fuso orario e sistema operativo del browser devono corrispondere al proxy, compresa l'impronta TCP/IP.

Domande frequenti

Lo scraping è legale?

Raccogliere dati pubblici non è di per sé illegale, ma dipende da quali dati raccogli, da come li usi e dalle condizioni del sito. I dati personali sono soggetti al GDPR. Per progetti importanti chiedi un parere legale.

Quante richieste posso fare con un proxy mobile?

Con ProxyHub il traffico è illimitato, ma il limite reale lo pone il sito: mantieni un ritmo ragionevole e distribuisci il carico nel tempo.

Mi conviene un proxy mobile per lo scraping?

Sì, se ti servono contenuti mobili o locali affidabili e siti con filtri severi. Per grandi volumi su siti senza filtri può bastare un proxy datacenter.

Prova un proxy mobile 5G

Smartphone dedicato, traffico illimitato, IP reali di operatori. Attivo in pochi minuti.

Scopri i piani

Leggi anche

Tutti gli articoli