Verifica e validatore robots.txt
Risposta breve
Controlla il tuo robots.txt: le regole, la riga della sitemap, se una pagina può essere scansionata e quali crawler di IA possono leggerla.
Cosa non fa: Legge le regole come sono scritte e non può dire se un crawler le rispetta; alcuni agenti IA che agiscono su richiesta di un utente possono ignorare robots.txt, e bloccare la scansione non toglie una pagina dai risultati di ricerca.
Cosa fa
Recupera il tuo `/robots.txt` e analizza ogni direttiva — gruppi User-agent, regole Allow/Disallow, Sitemap e Crawl-delay. Controlla se l'URL che hai inserito è consentito, usando la stessa precedenza per corrispondenza più lunga usata dai crawler reali, e segnala un `Disallow: /` generale, una direttiva sitemap mancante e un file di dimensioni eccessive. Elenca inoltre i principali crawler e token di controllo AI, mostra se ciascuno può recuperare quell'URL e spiega a cosa serve ognuno: addestrare modelli AI, risposte di ricerca AI, o aprire una pagina quando un utente lo chiede.
Perché è importante
Un solo `Disallow: /` fuori posto può impedire ai motori di ricerca di eseguire la scansione di un intero sito, ed è facile pubblicarlo per errore da una configurazione di staging. I crawler AI aggiungono una seconda domanda: bloccare un crawler di addestramento non ti rimuove dalle risposte di ricerca AI, ma bloccare un crawler di ricerca sì — quindi conviene sapere cosa fa ogni token.
Come funziona
-
Inserisci l'URL che vuoi testare
-
Recuperiamo `/robots.txt` e analizziamo ogni direttiva
-
Controlliamo se quell'URL è consentito per i crawler in generale e per ogni crawler AI, usando le regole di precedenza usate dai crawler reali
-
Segnaliamo un blocco dell'intero sito, un URL bloccato e una direttiva sitemap mancante, e spieghiamo ogni crawler AI
Esempio di input e output
url: https://rankproof.eu/tools
https://rankproof.eu/robots.txt: 200 OK dimensione file: 412 B · gruppi user-agent: 2 · crawl-delay: non impostato questa pagina è scansionabile OK direttiva sitemap presente OK Crawler AI — tutti possono leggere questa pagina: GPTBot Allowed OpenAI: raccoglie pagine per addestrare modelli AI. OAI-SearchBot Allowed OpenAI: indicizza le pagine così la sua ricerca AI può mostrarle e citarle. ChatGPT-User Allowed OpenAI: apre una pagina quando un utente chiede all'assistente al riguardo. Google-Extended Allowed Google: non è un crawler separato — è una regola per l'uso AI delle pagine che esegue già la scansione. …
Chi lo usa
-
SEO tecnico
Prima del lancio, controlla il robots.txt di produzione così una regola "blocca tutto" di staging non va mai in produzione.
-
Titolare del sito
Decidi quali crawler AI consentire: mantieni aperti i crawler di ricerca AI mentre scegli se le tue pagine possono addestrare modelli AI.
-
Content manager
Quando una sezione scompare da Google Search Console, controlla prima se robots.txt la blocca.
Domande frequenti
- Cos'è robots.txt?
- Un file di testo semplice alla radice del tuo dominio che dice ai crawler quali URL possono o non possono richiedere. È standardizzato nella RFC 9309 (2022).
- Posso bloccare i crawler AI separatamente?
- Sì — ognuno ha il proprio token user-agent, come `GPTBot` o `ClaudeBot`. Diverse aziende AI gestiscono crawler separati per l'addestramento dei modelli e per la ricerca, così puoi bloccare l'addestramento restando visibile nelle loro risposte di ricerca AI.
- Cos'è Google-Extended?
- Un token di controllo, non un crawler separato. Google esegue comunque la scansione con i suoi crawler abituali; disabilitare `Google-Extended` dice a Google di non usare i tuoi contenuti per addestrare i modelli Gemini o per basare le risposte nelle app Gemini. Non influisce su Google Search né sul posizionamento.
- Tutti i crawler AI rispettano robots.txt?
- Le principali aziende AI dicono che i loro crawler lo fanno. Alcuni fetcher che agiscono su richiesta di un utente, come ChatGPT-User e Perplexity-User, potrebbero non applicare le regole di robots.txt, e il report li segnala.
- Qual è la differenza tra robots.txt e noindex?
- robots.txt impedisce la scansione. `noindex` consente la scansione ma impedisce l'indicizzazione. Se blocchi una pagina in robots.txt, Google non può vedere il suo tag noindex — un errore comune.
- Dovrei includere una direttiva sitemap?
- Sì — `Sitemap: https://example.com/sitemap.xml` aiuta ogni crawler a trovare la tua sitemap, inclusi Bing e altri motori di ricerca.
- Google rispetta sempre robots.txt?
- Per la scansione, sì. Ma un URL bloccato può comunque comparire nei risultati di ricerca se altre pagine lo collegano — senza uno snippet. Usa noindex per tenere fuori una pagina.