Cómo hacer que la IA cite tu sitio
ChatGPT, Perplexity y los resúmenes de Google citan fuentes concretas. Qué hace que elijan la tuya: respuestas directas, HTML sin JavaScript, datos estructurados y un llms.txt.
Para que un asistente de IA cite tu sitio hacen falta tres cosas, y ninguna es un truco: que su rastreador pueda leerte, que la respuesta a la pregunta esté en una o dos frases claras, y que esas frases estén en el HTML sin ejecutar JavaScript. El resto —autoridad, enlaces, marca— pesa igual que en un buscador, pero esos tres puntos son los que deciden si tu página entra siquiera en la baraja.
La diferencia de fondo con el SEO clásico es qué se lleva el premio. Un buscador te manda a la página; un asistente extrae un fragmento y lo cita. Si tu contenido no tiene fragmentos extraíbles, no hay nada que citar aunque el artículo sea excelente.
Deja entrar a los que citan y decide sobre los demás
Empieza por el robots.txt, porque si bloqueas por defecto lo demás sobra. No todos los rastreadores de IA son iguales:
- Los que leen para responder y citan la fuente son los de los asistentes con búsqueda. Traen visitas reales y aparecen como enlace en la respuesta.
- Los que recolectan para entrenar consumen ancho de banda y no devuelven nada medible.
Se puede tratar a unos y otros de forma distinta, agente por agente. Nosotros damos a los primeros el mismo acceso que a Google —el contenido ya es público, no hay nada que ganar cerrándolo— y bloqueamos a los segundos. Cómo se escribe eso está en sitemap.xml y robots.txt.
Y una advertencia que ahorra disgustos: muchos rastreadores de IA no ejecutan JavaScript. Google al menos renderiza en una segunda pasada; varios de estos no lo hacen en absoluto. Si tu contenido aparece después de hidratar, para ellos tu página está vacía.
Escribe la respuesta antes que el gancho
Este es el cambio de redacción que más se nota, y va en contra de lo que enseña el copywriting clásico.
Un artículo humano puede abrir con una historia y llegar a la conclusión en el minuto tres. Un asistente no espera: busca el trozo que responde y lo cita. Si el primer párrafo es una pregunta retórica, no hay nada que extraer.
La solución no es escribir peor, es poner la respuesta directa en el primer o segundo párrafo y dejar el desarrollo después. Fíjate en cómo empieza este artículo: la respuesta completa está en la primera frase. El gancho puede venir a continuación, y el lector humano tampoco pierde nada — casi siempre gana.
Lo mismo vale por secciones: un encabezado que hace una pregunta y un primer párrafo que la contesta produce un fragmento citable por cada sección.
Estructura que se puede trocear
Lo que un modelo puede extraer bien:
- Encabezados que son preguntas. «¿Cuánto tarda Google en indexar?» se puede citar entero; «Sobre los tiempos», no.
- Secciones de preguntas frecuentes. Son pares de pregunta y respuesta ya delimitados. Es el formato con mejor relación entre esfuerzo y probabilidad de cita.
- Tablas comparativas. Un modelo las lee muy bien y son difíciles de parafrasear mal.
- Listas con la idea completa en cada punto, no con tres palabras que solo se entienden leyendo el párrafo de arriba.
Lo que se extrae mal: párrafos largos con la conclusión al final, ironía, y cualquier cosa que dependa de una imagen para entenderse.
Datos estructurados, ahora por partida doble
El JSON-LD se escribió para buscadores y resulta que a los modelos les viene igual de bien: es el dato limpio en vez de HTML del que adivinar. Un FAQPage bien hecho son literalmente pares de pregunta y respuesta listos para usar.
La regla es la misma de siempre, marcar solo lo que se ve, y la forma de garantizarlo es generar el schema del propio contenido en vez de escribirlo aparte. Está desarrollado en datos estructurados: qué marcar y qué no.
Añade un llms.txt
Es una convención sencilla: un archivo en Markdown, en la raíz del dominio, que resume el sitio para un modelo de lenguaje. La idea es que un asistente que quiere responder sobre tu sitio no tenga que rastrear cien páginas de HTML con menús y CSS para enterarse de qué hay.
Qué poner dentro:
- Un título y una frase que diga qué es el sitio.
- Las secciones principales, con enlace y una línea de descripción cada una.
- El contenido que de verdad quieres que se cite, con su enlace.
- Lo que no está ahí: lo que hay detrás de una cuenta no es tuyo para publicarlo.
Y una recomendación práctica: genéralo de la fuente real, no a mano. El nuestro sale del catálogo y del índice del blog en cada petición, así que incluye lo que se publicó ayer y no puede quedarse viejo. Un llms.txt desactualizado es peor que ninguno, porque describe un sitio que ya no existe.
Ojo: es una convención, no un estándar respaldado por nadie. Cuesta poco, no hace daño y algunos asistentes ya lo aprovechan. Trátalo así y no como una bala de plata.
Lo que no cambia
Nada de esto sustituye a lo de siempre. Los asistentes se apoyan en índices de búsqueda para saber qué existe, así que si no estás indexado, no te citan. Todo lo de SEO técnico para desarrolladores sigue siendo el suelo sobre el que se construye esto.
Y hay algo que no se puede optimizar: decir cosas concretas y comprobables. Un modelo cita mejor «la retención del plan gratuito es lo que decide si sirve para operar» que «es importante elegir bien tu proveedor». Los datos concretos son citables; el relleno, no.
Cómo saber si funciona
No hay un panel para esto todavía, así que toca ser artesanal:
- Pregunta directamente. Haz a varios asistentes las preguntas para las que escribiste y mira qué citan.
- Mira los registros del servidor. Los rastreadores de IA se identifican en el
user-agent. - Vigila el tráfico de referencia de los dominios de los asistentes en tu analítica.
Las cifras son pequeñas comparadas con la búsqueda tradicional. Están creciendo, y el trabajo que hay que hacer es en su mayoría el mismo que ya deberías estar haciendo.
Preguntas frecuentes
¿Debo bloquear a los rastreadores de IA? Depende de qué publiques. Si tu contenido es público y quieres visitas, bloquear a los que citan es renunciar a ese tráfico. Los que solo recolectan para entrenar son otra conversación, y ahí bloquear es razonable. Lo importante es decidirlo, no heredarlo por defecto.
¿Sirve de algo el llms.txt? Es barato de mantener si se genera solo, y algunos asistentes lo consultan. No es un estándar oficial ni hay garantía de que nadie lo lea. Merece la pena como complemento, nunca como sustituto de tener el contenido bien en HTML.
¿Google penaliza el contenido escrito con IA? Lo que penaliza es el contenido sin valor, escrito por quien sea. Un artículo generado que aporta algo concreto y comprobable no tiene problema; mil artículos genéricos publicados en una semana sí, y se detectan solos por el patrón.
¿Aparecer en un resumen de IA quita visitas? A veces sí: si la respuesta completa está en el resumen, mucha gente no hace clic. La defensa realista es escribir para que la respuesta corta deje ganas de más — datos concretos, herramientas, detalle que no cabe en dos frases —, y ser la fuente citada en vez de la ignorada.
¿Cuánto tarda en notarse? Los asistentes con búsqueda en vivo pueden citarte en días si ya estás indexado. Lo que se apoya en datos de entrenamiento tarda meses o no llega nunca. Optimiza para los primeros, que son además los que dejan un enlace.
El directorio es la otra mitad de esto
115 servicios con plan gratuito real, con los límites de cada uno escritos en claro. Sin registro para empezar a mirar.