Zum Inhalt springen
ProxyHub

Web Scraping mit Proxys: Best Practices, Grenzen und rechtliche Aspekte

Veröffentlicht am · 3 Min. Lesezeit

Preise, Verfügbarkeit oder Suchergebnisse zu beobachten gehört zum Alltag von E-Commerce-Teams und Analysten. Gut gemacht heißt: verlässliche Daten, ohne Websites zu überlasten und im Rahmen der Regeln. Proxys sind dabei nur ein Baustein.

Bevor Sie anfangen: Geht es einfacher?

Viele Websites bieten APIs, Produktfeeds oder Datenexporte an. Sie sind stabiler als Scraping, gehen nicht bei jedem Redesign kaputt und regeln klar, was Sie mit den Daten tun dürfen. Scraping ist sinnvoll, wenn es keine Alternative gibt oder diese nicht abdeckt, was Sie brauchen.

Rechtliche Aspekte, die Sie kennen sollten

Das ist keine Rechtsberatung, aber einige Punkte gelten fast überall:

  • Personenbezogene Daten: In Europa gilt die DSGVO auch für online veröffentlichte Daten. Namen, E-Mails, Fotos und Profile von Personen erfordern eine Rechtsgrundlage und besondere Schutzmaßnahmen. Wenn möglich, erheben Sie sie gar nicht.
  • Nutzungsbedingungen: Viele Websites regeln Scraping ausdrücklich. Verstöße können vertragliche Folgen haben.
  • Urheber- und Datenbankrecht: Inhalte oder ganze Datenbanken zu kopieren und neu zu veröffentlichen kann die Rechte des Inhabers verletzen.
  • Geschützte Bereiche: Erheben Sie keine Daten hinter Logins oder Zugangskontrollen ohne Erlaubnis.
Im Zweifel sprechen Sie mit einem Anwalt, bevor Sie ein Datenerhebungsprojekt in großem Umfang starten.

Wann Sie Proxys brauchen

  • Lokale Inhalte: Preise, Verfügbarkeit und Suchergebnisse ändern sich je nach Land. Mit einer italienischen, niederländischen, britischen oder französischen IP sehen Sie, was ein lokaler Nutzer sieht.
  • Mobile Version: Mit einem mobilen Proxy sehen Sie Inhalte wie ein Smartphone-Nutzer im Netz eines Betreibers.
  • Last verteilen: Viele Anfragen von einer einzigen IP werden gedrosselt, selbst wenn das Gesamttempo vernünftig ist.

Welcher Proxy-Typ passt, hängt von Volumen und Zielseiten ab: siehe Mobile, Residential und Rechenzentrums-Proxys.

Technische Best Practices

  1. Beachten Sie robots.txt und etwaige Vorgaben zur Crawl-Frequenz.
  2. Gehen Sie langsam vor: wenige Anfragen pro Sekunde, mit wechselnden Pausen. Das Tempo fällt mehr auf als die IP.
  3. Cachen Sie selten geänderte Seiten und laden Sie nur, was Sie brauchen.
  4. Behandeln Sie Fehler: Bei 429 (zu viele Anfragen) oder 503 warten Sie und verlängern die Pause bei jedem Versuch.
  5. Rotieren Sie mit Bedacht: in Intervallen oder wenn eine Website zu drosseln beginnt, nicht bei jeder Anfrage. Siehe IP-Rotation.
  6. Nutzen Sie realistische, konsistente Header (User Agent, Sprache).
  7. Arbeiten Sie möglichst zu verkehrsarmen Zeiten der Website.

Python-Beispiel

Ein Grundgerüst mit Pausen, Wiederholungen und IP-Rotation, wenn die Website mit einem Limit antwortet:

Python
import random, time, requests

PROXY = "http://BENUTZER:PASSWORT@HOST:PORT"
ROTATE = "ROTATIONSLINK"
session = requests.Session()
session.proxies = {"http": PROXY, "https": PROXY}

def fetch(url, tries=4):
    for attempt in range(tries):
        r = session.get(url, timeout=30)
        if r.status_code == 200:
            return r.text
        if r.status_code in (429, 503):
            requests.get(ROTATE, timeout=30)   # neue IP
            time.sleep(30 + 2 ** attempt)      # wachsende Wartezeit
            continue
        r.raise_for_status()
    raise RuntimeError(f"Zu viele Versuche: {url}")

for url in ["https://example.com/a", "https://example.com/b"]:
    html = fetch(url)
    time.sleep(random.uniform(2, 5))       # menschliches Tempo

Die Proxy-Einrichtung in Python und Node.js zeigen die Anleitungen zu Python und Node.js.

Mit einem automatisierten Browser

Websites, die Inhalte per JavaScript laden, erfordern einen automatisierten Browser (Playwright, Puppeteer, Selenium). Es gelten dieselben Regeln, mit besonderem Augenmerk auf Konsistenz: Sprache, Zeitzone und Betriebssystem des Browsers müssen zum Proxy passen, einschließlich des TCP/IP-Fingerprints.

Häufige Fragen

Ist Web Scraping legal?

Öffentliche Daten zu erheben ist an sich nicht illegal, es kommt aber darauf an, welche Daten Sie erheben, wie Sie sie nutzen und was die Bedingungen der Website sagen. Personenbezogene Daten unterliegen der DSGVO. Holen Sie bei größeren Projekten rechtlichen Rat ein.

Wie viele Anfragen kann ich über einen mobilen Proxy stellen?

Bei ProxyHub ist der Traffic unbegrenzt, das tatsächliche Limit setzt aber die Website: Halten Sie ein vernünftiges Tempo und verteilen Sie die Last über die Zeit.

Lohnt sich ein mobiler Proxy für Scraping?

Ja, wenn Sie verlässliche mobile oder lokale Inhalte und Websites mit strengen Filtern brauchen. Für große Volumen auf Websites ohne Filter kann ein Rechenzentrums-Proxy reichen.

Testen Sie einen mobilen 5G-Proxy

Dediziertes Smartphone, unbegrenzter Traffic, echte Mobilfunk-IPs. In wenigen Minuten aktiv.

Tarife ansehen

Weiterlesen

Alle Artikel