Scraping para alimentar un RAG
Guía paso a paso para convertir documentación pública en texto limpio, trocearlo y meterlo en un buscador semántico sin escribir un scraper a medida.
Blog
Revisar 115 servicios uno a uno enseña cosas que no salen en la página de precios. Aquí van, escritas para que sirvan antes de gastar una tarde.
16 artículos Página 1 de 2
Guía paso a paso para convertir documentación pública en texto limpio, trocearlo y meterlo en un buscador semántico sin escribir un scraper a medida.
Las cuatro preguntas que deciden si un scraping es defendible: datos públicos, términos de servicio, datos personales y derechos de autor. Con lo que no conviene hacer nunca.
Qué es el web scraping, cuándo compensa frente a una API oficial y las cinco decisiones que determinan si tu scraper aguanta un mes o se rompe el martes.
Las seis piezas que necesita un scraper —cliente HTTP, parser, navegador, proxy, cola y almacenamiento— y qué opciones tienen plan gratuito real en cada una.
ChatGPT, Perplexity y los resúmenes de Google citan fuentes concretas. Qué hace que elijan la tuya: respuestas directas, HTML sin JavaScript, datos estructurados y un llms.txt.
Las siete piezas que necesitas para medir y arreglar el SEO de un proyecto pequeño sin pagar nada, y qué mirar en el plan gratuito de cada una antes de montarla.
Cómo hacer que Google indexe las dos versiones de tu sitio en vez de tratar una como copia de la otra. Con el error de canonical que borra un idioma entero del índice.
JSON-LD explicado sin humo: qué tipos sirven de verdad, cómo evitar que el schema prometa algo que no está en la página y por qué no sube posiciones pero sí clics.
Guía paso a paso para que el sitemap liste exactamente lo público y el robots.txt bloquee solo lo privado. Con los tres fallos que no rompen nada y te sacan del índice.
115 servicios con plan gratuito real, con los límites de cada uno escritos en claro. Sin registro para empezar a mirar.