Web scraping con proxies: buenas prácticas, límites y aspectos legales
Publicado el · 3 min de lectura
Monitorizar precios, disponibilidad o resultados de búsqueda es el día a día de equipos de e-commerce y analistas. Hacerlo bien significa obtener datos fiables sin sobrecargar los sitios y respetando las reglas. Los proxies son solo una pieza del puzle.
Antes de empezar: ¿hay un camino más sencillo?
Muchos sitios ofrecen API, feeds de productos o exportaciones de datos. Son más estables que el scraping, no se rompen con cada rediseño y dejan claro qué puedes hacer con los datos. El scraping tiene sentido cuando no hay alternativas o estas no cubren lo que necesitas.
Aspectos legales que conviene conocer
No es asesoramiento jurídico, pero algunos puntos valen casi en todas partes:
- Datos personales: en Europa el RGPD se aplica también a los datos publicados en Internet. Nombres, emails, fotos y perfiles de personas requieren una base jurídica y garantías específicas. Si puedes, evita recogerlos.
- Condiciones de uso: muchos sitios regulan expresamente el scraping. Incumplirlas puede tener consecuencias contractuales.
- Derechos de autor y bases de datos: copiar y volver a publicar contenidos o bases de datos enteras puede vulnerar los derechos del titular.
- Zonas protegidas: no recojas datos que estén tras un inicio de sesión o controles de acceso sin autorización.
Cuándo hacen falta los proxies
- Contenidos locales: precios, disponibilidad y resultados de búsqueda cambian según el país. Con una IP italiana, neerlandesa, británica o francesa ves lo que ve un usuario local.
- Versión móvil: con un proxy móvil ves los contenidos como un usuario de smartphone en la red de un operador.
- Repartir la carga: muchas peticiones desde una sola IP acaban limitadas aunque el ritmo total sea razonable.
Qué tipo de proxy elegir depende del volumen y de los sitios objetivo: consulta Proxies móviles, residenciales y de datacenter.
Buenas prácticas técnicas
- Respeta robots.txt y las posibles indicaciones sobre la frecuencia de rastreo.
- Ve despacio: pocas peticiones por segundo, con pausas variables. El ritmo llama más la atención que la IP.
- Usa caché para las páginas que cambian poco y descarga solo lo que necesitas.
- Gestiona los errores: ante un 429 (demasiadas peticiones) o un 503, espera, aumentando la pausa en cada intento.
- Rota con criterio: por intervalos o cuando un sitio empieza a limitarte, no en cada petición. Consulta Rotación de IP.
- Usa cabeceras realistas y coherentes (user agent, idioma).
- Trabaja en las horas de menos tráfico del sitio cuando sea posible.
Ejemplo en Python
Un esqueleto con pausas, reintentos y rotación de la IP cuando el sitio responde con un límite:
import random, time, requests
PROXY = "http://USUARIO:CONTRASEÑA@HOST:PUERTO"
ROTATE = "ENLACE_DE_ROTACION"
session = requests.Session()
session.proxies = {"http": PROXY, "https": PROXY}
def fetch(url, tries=4):
for attempt in range(tries):
r = session.get(url, timeout=30)
if r.status_code == 200:
return r.text
if r.status_code in (429, 503):
requests.get(ROTATE, timeout=30) # IP nueva
time.sleep(30 + 2 ** attempt) # espera creciente
continue
r.raise_for_status()
raise RuntimeError(f"Demasiados intentos: {url}")
for url in ["https://example.com/a", "https://example.com/b"]:
html = fetch(url)
time.sleep(random.uniform(2, 5)) # ritmo humanoLa configuración del proxy en Python y Node.js está en las guías de Python y Node.js.
Con un navegador automatizado
Los sitios que cargan los contenidos con JavaScript requieren un navegador automatizado (Playwright, Puppeteer, Selenium). Valen las mismas reglas, con más atención a la coherencia: idioma, zona horaria y sistema operativo del navegador deben coincidir con el proxy, incluida la huella TCP/IP.
Preguntas frecuentes
¿El web scraping es legal?
Recoger datos públicos no es ilegal en sí, pero depende de qué datos recoges, cómo los usas y las condiciones del sitio. Los datos personales están sujetos al RGPD. Para proyectos importantes, busca asesoramiento legal.
¿Cuántas peticiones puedo hacer con un proxy móvil?
Con ProxyHub el tráfico es ilimitado, pero el límite real lo marca el sitio: mantén un ritmo razonable y reparte la carga en el tiempo.
¿Compensa un proxy móvil para el scraping?
Sí, si necesitas contenidos móviles o locales fiables y sitios con filtros estrictos. Para grandes volúmenes en sitios sin filtros puede bastar un proxy de datacenter.
Prueba un proxy móvil 5G
Smartphone dedicado, tráfico ilimitado, IP reales de operadores. Activo en pocos minutos.
Ver planes