IA y GEO: Optimizar para la búsqueda impulsada por inteligencia artificial
Lo que los asistentes de búsqueda con IA necesitan realmente de un sitio web —acceso del rastreador, indexación y permiso de fragmento—, qué rastreadores de IA permitir en robots.txt, qué hacen y qué no llms.txt y los datos estructurados, y cifras de nuestro estudio de 4645 sitios de la UE.
Respuesta breve
Para aparecer en las respuestas de búsqueda con IA, una página debe poder rastrearse e indexarse por los sistemas de búsqueda de los que beben esas respuestas, y poder mostrarse como fragmento. Google dice que AI Overviews y el modo IA no necesitan archivos ni marcado especiales; la búsqueda de ChatGPT, Claude y Perplexity usan sus propios rastreadores, que robots.txt puede permitir o bloquear. Más allá del acceso, lo que hace buena una página para la búsqueda la hace citable: una respuesta clara, datos con fuentes y texto que una máquina pueda leer.
- Archivos especiales para las funciones de IA de Google
- Ninguno
- Ajustes que limitan el uso
- noindex · nosnippet · max-snippet
- Rastreadores de búsqueda con IA
- OAI-SearchBot · Claude-SearchBot · PerplexityBot
- Sitios de la UE que no bloquean ningún rastreador de IA
- 81,7 % de 4645
- Sitios de la UE con un llms.txt válido
- 9,4 %
Fuentes primarias
- AI features and your website — Google Search Central
- Robots meta tag, data-nosnippet, and X-Robots-Tag specifications — Google Search Central
- Google crawlers and fetchers — Google Search Central
- Overview of OpenAI crawlers — OpenAI
- RFC 9309: Robots Exclusion Protocol — IETF
- The /llms.txt file — llmstxt.org
IA y GEO: Optimizar para la búsqueda impulsada por inteligencia artificial
Se llama «generative engine optimisation» (GEO) al intento de que una página se cite en respuestas de IA: AI Overviews y modo IA de Google, búsqueda de ChatGPT, Claude, Perplexity, Copilot. Mucho de lo que se vende con ese nombre no tiene base documentada. Esta guía separa lo que documentan los operadores de lo que es suposición, y da cifras de nuestro propio estudio de sitios de la UE.
Lo que documentan de verdad los operadores
Google. Su documentación sobre las funciones de IA dice que no hay requisitos adicionales para aparecer en AI Overviews o en el modo IA ni optimizaciones especiales: la página debe estar indexada y poder mostrarse en la Búsqueda con un fragmento. Se aplican las buenas prácticas habituales: permitir el rastreo, enlazar las páginas internamente, mantener el contenido importante en texto y que los datos estructurados coincidan con la página visible. No necesita archivos de texto para IA ni marcado especial.
OpenAI, Anthropic, Perplexity. Cada uno usa rastreadores distintos para fines distintos, y todos afirman que sus rastreadores respetan robots.txt:
| Operador | Rastreador de búsqueda / respuestas | Obtención a petición de un usuario | Rastreador de entrenamiento |
|---|---|---|---|
| OpenAI | OAI-SearchBot | ChatGPT-User | GPTBot |
| Anthropic | Claude-SearchBot | Claude-User | ClaudeBot |
| Perplexity | PerplexityBot | Perplexity-User | — |
| Googlebot (Búsqueda, AI Overviews, modo IA) | — | Google-Extended (token de control, no un rastreador) |
La distinción importante: bloquear un rastreador de entrenamiento no le saca de la búsqueda con IA, y bloquear uno de búsqueda sí. Si quiere, por ejemplo, que le citen en la búsqueda de ChatGPT, OAI-SearchBot debe estar permitido; GPTBot puede bloquearse por separado. Google-Extended controla si el contenido se usa para los modelos Gemini y no afecta a la inclusión en la Búsqueda de Google. Copilot de Microsoft se basa en el índice de Bing, así que ahí importa el acceso de Bingbot.
Paso 1: acceso
- robots.txt: permita los rastreadores de búsqueda y de usuario que quiere que le citen. Las reglas siguen la RFC 9309: se aplica el grupo coincidente más específico y gana la ruta coincidente más larga.
- Ningún bloqueo accidental en la red. La protección contra bots puede desafiar a rastreadores que robots.txt permite; revise en los registros de su cortafuegos o CDN las peticiones bloqueadas de los rastreadores anteriores.
- Indexación: ningún
noindexen las páginas que quiere que se citen. - Permiso de fragmento:
nosnippet,data-nosnippetymax-snippetlimitan lo que Google puede mostrar, también en las funciones de IA. Úselos a propósito, no como valor por defecto de una plantilla.
Qué hacen hoy los sitios de la UE
En septiembre de 2026 revisamos el robots.txt y el /llms.txt de sitios nacionales populares de los 27 países de la UE —hasta 200 por país, de la lista Chrome UX Report de agosto de 2026—. De los 4645 sitios que pudimos medir:
| Hallazgo | Porcentaje de sitios |
|---|---|
| No bloquean ningún rastreador de IA | 81,7 % |
| Bloquean al menos un rastreador de entrenamiento | 16,5 % |
| Bloquean al menos un rastreador de búsqueda o de usuario de IA | 10,1 % |
| Bloquean todos los rastreadores de búsqueda y de usuario de IA | 4,3 % |
| Bloquean GPTBot | 13,8 % |
| Bloquean OAI-SearchBot | 6,7 % |
| Publican un /llms.txt válido (de 4260 revisados) | 9,4 % |
Dos lecciones. La mayoría de los sitios no bloquea nada, así que el acceso rara vez es el problema. Y quienes bloquean, bloquean más a menudo rastreadores de entrenamiento que de búsqueda, lo que encaja con la distinción anterior. Nuestro estudio «Bloqueo de rastreadores de IA en los sitios de la UE» recoge las cifras por país y por rastreador, y el método.
Paso 2: merecer ser citado
Las respuestas de IA citan páginas que responden con claridad a una pregunta y son fiables. Nada de esto es un factor de posicionamiento secreto; es lo que pide de todos modos la guía de Google sobre contenido útil:
- Primero la respuesta. Dé la respuesta en las primeras líneas y después explique. Quien lea en diagonal —persona o máquina— debe encontrarla sin desplazarse.
- Una página, una pregunta. Las páginas que mezclan varios temas se citan con más dificultad.
- Datos con fuentes. Cifras con fecha y enlace a su origen; fuentes primarias antes que resúmenes.
- Tablas y listas para los datos que de otro modo quedarían enterrados en el texto.
- Información original. Sus propias mediciones, ejemplos y experiencia son lo que una respuesta de IA no encuentra en otro sitio, y el motivo para citarle.
- Autoría y fechas claras. Quién publica la página, cómo se elaboró y cuándo cambió por última vez en lo sustancial.
Qué hacen —y qué no— llms.txt y los datos estructurados
llms.txt es una propuesta de archivo Markdown en /llms.txt que orienta a los modelos de lenguaje hacia las páginas clave de un sitio. Es fácil de publicar e inofensivo, pero ningún gran operador de búsqueda con IA documenta que lo lea, y Google dice que no hace falta un archivo así. Considérelo opcional; solo el 9,4 % de los sitios de la UE que medimos tiene uno válido.
Los datos estructurados (JSON-LD con tipos de schema.org) ayudan a los buscadores a entender las entidades de una página —una organización, un producto, un artículo— y deben coincidir con el contenido visible. Por sí solos no meten una página en las respuestas de IA.
Medir
No existe un informe completo de citas en IA. Lo que sí puede ver: en Search Console, los clics desde AI Overviews y el modo IA se cuentan en el informe de Rendimiento junto con los resultados web; las visitas desde ChatGPT, Perplexity, Copilot y asistentes similares aparecen como referencias en su analítica; y los registros del servidor muestran qué rastreadores de IA obtuvieron qué páginas. Desconfíe de cualquier herramienta que prometa una «puntuación de visibilidad en IA» completa en todos los asistentes.
Comprobarlo con RankProof
La comprobación de preparación para IA de RankProof solo puntúa las señales que documentan los operadores: si los rastreadores de búsqueda y de usuario de IA (y también Googlebot y Bingbot) pueden leer la página, si es indexable y si los ajustes de fragmento la bloquean. Lo opcional —llms.txt, una versión en Markdown, datos estructurados— se muestra pero no se puntúa. El comprobador de robots.txt muestra qué rastreadores permiten sus reglas, el generador de robots.txt escribe reglas por grupo de rastreadores y el generador de llms.txt redacta el archivo si decide publicarlo.
Herramientas gratuitas sobre este tema
Datos de estudio sobre este tema
¿Listo para posicionarte mejor?
Usa las herramientas gratuitas de RankProof para mejorar tus posiciones de búsqueda y avanzar hacia el cumplimiento de accesibilidad de la UE.
Probar escaneo gratuito