Comprobador y validador de robots.txt
Respuesta breve
Comprueba tu robots.txt: sus reglas, la línea del sitemap, si una página se puede rastrear y qué rastreadores de IA pueden leerla.
Lo que no hace: Lee las reglas tal como están escritas y no puede saber si un rastreador las cumple; algunos agentes de IA que actúan a petición de un usuario pueden ignorar robots.txt, y bloquear el rastreo no quita una página de los resultados de búsqueda.
Qué hace
Obtiene tu `/robots.txt` y analiza todas sus directivas — grupos de User-agent, reglas Allow/Disallow, Sitemap y Crawl-delay. Comprueba si la URL que has introducido está permitida, usando el mismo criterio de precedencia por coincidencia más larga que usan los rastreadores reales, y marca un `Disallow: /` general, una directiva de sitemap ausente y un archivo con un tamaño excesivo. También enumera los principales rastreadores y tokens de control de IA, muestra si cada uno puede obtener esa URL y explica para qué sirve cada uno: entrenar modelos de IA, respuestas de búsqueda con IA o abrir una página cuando un usuario lo solicita.
Por qué importa
Un simple `Disallow: /` puede impedir que los buscadores rastreen todo un sitio, y es fácil publicarlo por accidente desde una configuración de staging. Los rastreadores de IA añaden una segunda cuestión: bloquear un rastreador de entrenamiento no te elimina de las respuestas de búsqueda con IA, pero bloquear un rastreador de búsqueda sí puede hacerlo — así que conviene saber qué hace cada token.
Cómo funciona
-
Introduce la URL que quieres probar
-
Obtenemos `/robots.txt` y analizamos todas sus directivas
-
Comprobamos si esa URL está permitida para los rastreadores en general y para cada rastreador de IA, usando las reglas de precedencia que usan los rastreadores reales
-
Marcamos un bloqueo de todo el sitio, una URL bloqueada y una directiva de sitemap ausente, y explicamos cada rastreador de IA
Ejemplo de entrada y salida
url: https://rankproof.eu/tools
https://rankproof.eu/robots.txt: 200 OK tamaño del archivo: 412 B · grupos de user-agent: 2 · crawl-delay: no definido esta página se puede rastrear OK directiva sitemap presente OK Rastreadores de IA — todos pueden leer esta página: GPTBot Permitido OpenAI: recopila páginas para entrenar modelos de IA. OAI-SearchBot Permitido OpenAI: indexa páginas para que su búsqueda de IA pueda mostrarlas y citarlas. ChatGPT-User Permitido OpenAI: abre una página cuando un usuario le pregunta al asistente sobre ella. Google-Extended Permitido Google: no es un rastreador aparte, sino una regla para el uso con IA de las páginas que rastrea. …
Quién lo usa
-
SEO técnico
Antes del lanzamiento, comprueba el robots.txt de producción para que una regla de "bloquear todo" de staging nunca llegue a producción.
-
Propietario del sitio
Decide qué rastreadores de IA permitir: mantén abiertos los rastreadores de búsqueda con IA mientras eliges si tus páginas pueden entrenar modelos de IA.
-
Gestor de contenidos
Cuando una sección desaparece de Google Search Console, comprueba primero si robots.txt la bloquea.
Preguntas frecuentes
- ¿Qué es robots.txt?
- Un archivo de texto plano en la raíz de tu dominio que indica a los rastreadores qué URL pueden o no solicitar. Está estandarizado en el RFC 9309 (2022).
- ¿Puedo bloquear rastreadores de IA por separado?
- Sí — cada uno tiene su propio token de user-agent, como `GPTBot` o `ClaudeBot`. Varias empresas de IA usan rastreadores distintos para entrenamiento de modelos y para búsqueda, así que puedes bloquear el entrenamiento y seguir apareciendo en sus respuestas de búsqueda con IA.
- ¿Qué es Google-Extended?
- Un token de control, no un rastreador aparte. Google rastrea igualmente con sus rastreadores habituales; bloquear `Google-Extended` le indica a Google que no use tu contenido para entrenar los modelos Gemini ni para fundamentar respuestas en las apps de Gemini. No afecta a Google Search ni al posicionamiento.
- ¿Todos los rastreadores de IA respetan robots.txt?
- Las principales empresas de IA dicen que sus rastreadores lo hacen. Algunos captadores que actúan por petición de un usuario, como ChatGPT-User y Perplexity-User, pueden no aplicar las reglas de robots.txt, y el informe los señala.
- ¿Cuál es la diferencia entre robots.txt y noindex?
- robots.txt impide el rastreo. `noindex` permite el rastreo pero impide la indexación. Si bloqueas una página en robots.txt, Google no puede ver su etiqueta noindex — un error habitual.
- ¿Debería incluir una directiva de sitemap?
- Sí — `Sitemap: https://example.com/sitemap.xml` ayuda a todos los rastreadores a encontrar tu sitemap, incluidos Bing y otros buscadores.
- ¿Google siempre respeta robots.txt?
- Para el rastreo, sí. Pero una URL bloqueada aún puede aparecer en los resultados de búsqueda si otras páginas la enlazan, sin fragmento. Usa noindex para mantener una página fuera.