Saltar al contenido
AI & GEO 6 min de lectura

IA y GEO: Optimizar para la búsqueda impulsada por inteligencia artificial

Lo que los asistentes de búsqueda con IA necesitan realmente de un sitio web —acceso del rastreador, indexación y permiso de fragmento—, qué rastreadores de IA permitir en robots.txt, qué hacen y qué no llms.txt y los datos estructurados, y cifras de nuestro estudio de 4645 sitios de la UE.

RP
Por RankProof
Equipo Editorial · RankProof

Respuesta breve

Para aparecer en las respuestas de búsqueda con IA, una página debe poder rastrearse e indexarse por los sistemas de búsqueda de los que beben esas respuestas, y poder mostrarse como fragmento. Google dice que AI Overviews y el modo IA no necesitan archivos ni marcado especiales; la búsqueda de ChatGPT, Claude y Perplexity usan sus propios rastreadores, que robots.txt puede permitir o bloquear. Más allá del acceso, lo que hace buena una página para la búsqueda la hace citable: una respuesta clara, datos con fuentes y texto que una máquina pueda leer.

Archivos especiales para las funciones de IA de Google
Ninguno
Ajustes que limitan el uso
noindex · nosnippet · max-snippet
Rastreadores de búsqueda con IA
OAI-SearchBot · Claude-SearchBot · PerplexityBot
Sitios de la UE que no bloquean ningún rastreador de IA
81,7 % de 4645
Sitios de la UE con un llms.txt válido
9,4 %

IA y GEO: Optimizar para la búsqueda impulsada por inteligencia artificial

Se llama «generative engine optimisation» (GEO) al intento de que una página se cite en respuestas de IA: AI Overviews y modo IA de Google, búsqueda de ChatGPT, Claude, Perplexity, Copilot. Mucho de lo que se vende con ese nombre no tiene base documentada. Esta guía separa lo que documentan los operadores de lo que es suposición, y da cifras de nuestro propio estudio de sitios de la UE.

Lo que documentan de verdad los operadores

Google. Su documentación sobre las funciones de IA dice que no hay requisitos adicionales para aparecer en AI Overviews o en el modo IA ni optimizaciones especiales: la página debe estar indexada y poder mostrarse en la Búsqueda con un fragmento. Se aplican las buenas prácticas habituales: permitir el rastreo, enlazar las páginas internamente, mantener el contenido importante en texto y que los datos estructurados coincidan con la página visible. No necesita archivos de texto para IA ni marcado especial.

OpenAI, Anthropic, Perplexity. Cada uno usa rastreadores distintos para fines distintos, y todos afirman que sus rastreadores respetan robots.txt:

OperadorRastreador de búsqueda / respuestasObtención a petición de un usuarioRastreador de entrenamiento
OpenAIOAI-SearchBotChatGPT-UserGPTBot
AnthropicClaude-SearchBotClaude-UserClaudeBot
PerplexityPerplexityBotPerplexity-User—
GoogleGooglebot (Búsqueda, AI Overviews, modo IA)—Google-Extended (token de control, no un rastreador)

La distinción importante: bloquear un rastreador de entrenamiento no le saca de la búsqueda con IA, y bloquear uno de búsqueda sí. Si quiere, por ejemplo, que le citen en la búsqueda de ChatGPT, OAI-SearchBot debe estar permitido; GPTBot puede bloquearse por separado. Google-Extended controla si el contenido se usa para los modelos Gemini y no afecta a la inclusión en la Búsqueda de Google. Copilot de Microsoft se basa en el índice de Bing, así que ahí importa el acceso de Bingbot.

Paso 1: acceso

  1. robots.txt: permita los rastreadores de búsqueda y de usuario que quiere que le citen. Las reglas siguen la RFC 9309: se aplica el grupo coincidente más específico y gana la ruta coincidente más larga.
  2. Ningún bloqueo accidental en la red. La protección contra bots puede desafiar a rastreadores que robots.txt permite; revise en los registros de su cortafuegos o CDN las peticiones bloqueadas de los rastreadores anteriores.
  3. Indexación: ningún noindex en las páginas que quiere que se citen.
  4. Permiso de fragmento: nosnippet, data-nosnippet y max-snippet limitan lo que Google puede mostrar, también en las funciones de IA. Úselos a propósito, no como valor por defecto de una plantilla.

Qué hacen hoy los sitios de la UE

En septiembre de 2026 revisamos el robots.txt y el /llms.txt de sitios nacionales populares de los 27 países de la UE —hasta 200 por país, de la lista Chrome UX Report de agosto de 2026—. De los 4645 sitios que pudimos medir:

HallazgoPorcentaje de sitios
No bloquean ningún rastreador de IA81,7 %
Bloquean al menos un rastreador de entrenamiento16,5 %
Bloquean al menos un rastreador de búsqueda o de usuario de IA10,1 %
Bloquean todos los rastreadores de búsqueda y de usuario de IA4,3 %
Bloquean GPTBot13,8 %
Bloquean OAI-SearchBot6,7 %
Publican un /llms.txt válido (de 4260 revisados)9,4 %

Dos lecciones. La mayoría de los sitios no bloquea nada, así que el acceso rara vez es el problema. Y quienes bloquean, bloquean más a menudo rastreadores de entrenamiento que de búsqueda, lo que encaja con la distinción anterior. Nuestro estudio «Bloqueo de rastreadores de IA en los sitios de la UE» recoge las cifras por país y por rastreador, y el método.

Paso 2: merecer ser citado

Las respuestas de IA citan páginas que responden con claridad a una pregunta y son fiables. Nada de esto es un factor de posicionamiento secreto; es lo que pide de todos modos la guía de Google sobre contenido útil:

  • Primero la respuesta. Dé la respuesta en las primeras líneas y después explique. Quien lea en diagonal —persona o máquina— debe encontrarla sin desplazarse.
  • Una página, una pregunta. Las páginas que mezclan varios temas se citan con más dificultad.
  • Datos con fuentes. Cifras con fecha y enlace a su origen; fuentes primarias antes que resúmenes.
  • Tablas y listas para los datos que de otro modo quedarían enterrados en el texto.
  • Información original. Sus propias mediciones, ejemplos y experiencia son lo que una respuesta de IA no encuentra en otro sitio, y el motivo para citarle.
  • Autoría y fechas claras. Quién publica la página, cómo se elaboró y cuándo cambió por última vez en lo sustancial.

Qué hacen —y qué no— llms.txt y los datos estructurados

llms.txt es una propuesta de archivo Markdown en /llms.txt que orienta a los modelos de lenguaje hacia las páginas clave de un sitio. Es fácil de publicar e inofensivo, pero ningún gran operador de búsqueda con IA documenta que lo lea, y Google dice que no hace falta un archivo así. Considérelo opcional; solo el 9,4 % de los sitios de la UE que medimos tiene uno válido.

Los datos estructurados (JSON-LD con tipos de schema.org) ayudan a los buscadores a entender las entidades de una página —una organización, un producto, un artículo— y deben coincidir con el contenido visible. Por sí solos no meten una página en las respuestas de IA.

Medir

No existe un informe completo de citas en IA. Lo que sí puede ver: en Search Console, los clics desde AI Overviews y el modo IA se cuentan en el informe de Rendimiento junto con los resultados web; las visitas desde ChatGPT, Perplexity, Copilot y asistentes similares aparecen como referencias en su analítica; y los registros del servidor muestran qué rastreadores de IA obtuvieron qué páginas. Desconfíe de cualquier herramienta que prometa una «puntuación de visibilidad en IA» completa en todos los asistentes.

Comprobarlo con RankProof

La comprobación de preparación para IA de RankProof solo puntúa las señales que documentan los operadores: si los rastreadores de búsqueda y de usuario de IA (y también Googlebot y Bingbot) pueden leer la página, si es indexable y si los ajustes de fragmento la bloquean. Lo opcional —llms.txt, una versión en Markdown, datos estructurados— se muestra pero no se puntúa. El comprobador de robots.txt muestra qué rastreadores permiten sus reglas, el generador de robots.txt escribe reglas por grupo de rastreadores y el generador de llms.txt redacta el archivo si decide publicarlo.

¿Listo para posicionarte mejor?

Usa las herramientas gratuitas de RankProof para mejorar tus posiciones de búsqueda y avanzar hacia el cumplimiento de accesibilidad de la UE.

Probar escaneo gratuito