tabteca
Entrar
ES EN

Herramientas de scraping gratis

Las seis piezas que necesita un scraper —cliente HTTP, parser, navegador, proxy, cola y almacenamiento— y qué opciones tienen plan gratuito real en cada una.

Para montar un scraper que aguante hacen falta seis piezas, y casi todas tienen una opción gratuita de verdad: algo que pida la página, algo que la parsee, un navegador para cuando el HTML no basta, una cola para no ir en serie eternamente, un sitio donde guardar y algo que te avise cuando se rompa. Lo caro no es ninguna de ellas por separado: es no saber cuál necesitas.

Aquí va la lista, en el orden en que se montan. Los límites concretos de cada servicio están en su ficha del directorio, porque cambian a menudo y aquí se quedarían viejos.

1. El cliente HTTP: lo que ya tienes

La primera pieza es gratis en todos los lenguajes y no hace falta instalar nada: fetch en Node y en el navegador, requests o httpx en Python, curl en la terminal.

Lo que importa no es la biblioteca, son tres ajustes: tiempo de espera (sin él, un servidor lento te cuelga el proceso entero), reintentos con retroceso exponencial y un User-Agent que te identifique. Con eso cubres el 80 % de los sitios renderizados en el servidor.

Para probar peticiones antes de escribir código, Hoppscotch es un cliente de API que funciona en el navegador y tiene plan gratuito.

2. El parser: de HTML a datos

Aquí también manda el ecosistema del lenguaje, y todo lo bueno es de código abierto: BeautifulSoup y lxml en Python, Cheerio en Node.

El consejo que ahorra más trabajo no es de biblioteca: antes de parsear HTML, busca el JSON-LD de la página. Muchísimos sitios llevan el precio, la fecha y el autor declarados en un bloque application/ld+json porque lo ponen para Google, y leerlo de ahí es infinitamente más estable que perseguir clases de CSS.

3. El navegador sin interfaz: solo cuando hace falta

Playwright y Puppeteer son gratuitos y de código abierto, y son la respuesta cuando el contenido solo existe después de ejecutar JavaScript.

Dos avisos:

  • Compruébalo antes. Pide la URL con curl y busca tu dato. Si está en el HTML, el navegador solo te añade latencia y memoria.
  • Es caro de operar. Cada instancia consume cientos de megabytes. En una función sin servidor, muchas veces no cabe.

Si necesitas navegador pero no quieres mantener la infraestructura, hay servicios que lo alojan; ahí el plan gratuito suele contarse en minutos de navegador al mes, y se agota rápido.

4. Las APIs de scraping: pagar por no mantenerlo

Son servicios a los que les pasas una URL y te devuelven el contenido ya resuelto. Te ahorran el navegador, los reintentos y buena parte del mantenimiento.

Firecrawl es la opción del directorio con plan gratuito: convierte una página o un sitio entero en Markdown limpio, que es exactamente lo que quieres si el destino es un modelo de lenguaje. Lo desarrollamos en scraping para alimentar un RAG.

Para casos más acotados hay APIs pequeñas que evitan escribir un scraper entero: OpenGraph.to devuelve título, descripción e imagen de cualquier URL, y Abstract API tiene un conjunto de utilidades con cuota gratuita propia. Si solo necesitas metadatos de enlaces, no montes un scraper.

En el plan gratuito de cualquiera de estos, mira créditos al mes y qué cuenta como crédito: en algunos, una página con JavaScript vale por cinco.

5. La cola: para no ir en serie eternamente

En cuanto pasas de cien URLs, necesitas algo que reparta el trabajo, reintente lo que falla y no dispare todo a la vez contra el mismo dominio.

Para un proyecto pequeño, una tabla con estado (pendiente, hecho, fallido) y un bucle es suficiente y no añade dependencias. Cuando crezca, Upstash da Redis y colas con plan gratuito por petición, que encaja bien con ejecuciones esporádicas, y Pipedream sirve para orquestar la tanda sin montar servidor.

Regla que casi nadie aplica y evita bloqueos: el paralelismo se limita por dominio, no en total. Diez peticiones a la vez repartidas entre diez sitios no molestan a nadie; diez a la vez contra uno solo, sí.

6. Guardar y enterarte cuando falle

Para guardar, Postgres cubre casi todo y es lo más portable: Supabase y Neon tienen plan gratuito, y lo comparamos en bases de datos con plan gratuito. Guarda también el HTML crudo: el día que descubras que leías mal un campo, poder reprocesar sin volver a pedir las páginas lo vale.

Y lo que casi nadie monta: avisos. Un scraper falla en silencio, devolviendo cero filas sin lanzar ningún error. Healthchecks.io avisa cuando una tarea programada deja de dar señales, y Sentry recoge las excepciones. Toda la categoría en monitorización.

Lo que no conviene hacer gratis

Los servicios de proxies residenciales y de resolución de CAPTCHAs. No es una cuestión de precio: son justo la frontera donde el scraping deja de ser leer una página pública y pasa a ser esquivar a alguien que te ha dicho que no. Está desarrollado en scraping legal: qué se puede y qué no.

Si un sitio te bloquea de forma sistemática, la respuesta útil casi nunca es insistir con más disfraz: es bajar el ritmo, identificarte o escribir a quien lo mantiene.

Preguntas frecuentes

¿Se puede scrapear sin pagar nada? Para un proyecto pequeño, sí y de sobra: el cliente HTTP, el parser y el navegador son de código abierto, y la base de datos y los avisos tienen plan gratuito. Lo primero que suele obligar a pagar no es el scraping, es el volumen de almacenamiento o los minutos de navegador.

¿Merece la pena una API de scraping o mejor lo monto yo? Móntalo tú si el sitio es sencillo y son pocas páginas; paga si necesitas navegador, muchos dominios distintos o no quieres mantenerlo. El coste real de un scraper propio no es escribirlo, es arreglarlo cada vez que el sitio cambia.

¿Qué es lo primero que se rompe? Casi siempre el selector, porque el sitio cambió de maquetación. Por eso conviene leer datos estructurados cuando los haya y contar cuántas filas extraes en cada tanda: una caída brusca es la señal, y llega antes que cualquier excepción.

¿Necesito proxies? Para un proyecto normal, no. Si crees que sí, casi siempre lo que necesitas de verdad es ir más despacio, cachear e identificarte. Los proxies resuelven un problema de escala que la mayoría de los proyectos no tiene.

¿Puedo scrapear desde una función sin servidor? Con peticiones HTTP, sí y encaja muy bien. Con navegador sin interfaz, depende del límite de memoria y de tiempo de ejecución de tu plataforma; es una de las cosas que conviene comprobar antes, como el resto de límites de los planes gratuitos que nadie lee.

El directorio es la otra mitad de esto

115 servicios con plan gratuito real, con los límites de cada uno escritos en claro. Sin registro para empezar a mirar.

Explorar el directorio

← Todos los artículos

Sigue leyendo

5 min de lectura

Scraping legal: qué se puede y qué no

Las cuatro preguntas que deciden si un scraping es defendible: datos públicos, términos de servicio, datos personales y derechos de autor. Con lo que no conviene hacer nunca.

ScrapingLegalGuías

5 min de lectura

Scraping para alimentar un RAG

Guía paso a paso para convertir documentación pública en texto limpio, trocearlo y meterlo en un buscador semántico sin escribir un scraper a medida.

ScrapingIAGuías

5 min de lectura

Web scraping: por dónde empezar

Qué es el web scraping, cuándo compensa frente a una API oficial y las cinco decisiones que determinan si tu scraper aguanta un mes o se rompe el martes.

ScrapingDatosGuías