Aller au contenu
AI & GEO 6 min de lecture

IA & GEO : optimiser pour la recherche pilotée par l'IA

Ce dont les assistants de recherche IA ont vraiment besoin d’un site — accès des robots, indexation et autorisation d’extrait —, quels robots d’IA autoriser dans robots.txt, ce que font et ne font pas llms.txt et les données structurées, et les chiffres de notre étude de 4 645 sites de l’UE.

RP
Par RankProof
Équipe éditoriale · RankProof

Réponse courte

Pour apparaître dans les réponses de recherche par IA, une page doit d’abord pouvoir être explorée et indexée par les systèmes de recherche dont ces réponses s’inspirent, et pouvoir être affichée en extrait. Google indique que les AI Overviews et le mode IA ne demandent ni fichier ni balisage particuliers ; la recherche de ChatGPT, Claude et Perplexity utilisent leurs propres robots, que robots.txt peut autoriser ou bloquer. Au-delà de l’accès, ce qui rend une page bonne pour la recherche la rend citable : une réponse claire, des faits sourcés et un texte lisible par une machine.

Fichiers spéciaux pour les fonctions IA de Google
Aucun
Réglages qui limitent l’usage
noindex · nosnippet · max-snippet
Robots de recherche IA
OAI-SearchBot · Claude-SearchBot · PerplexityBot
Sites de l’UE ne bloquant aucun robot d’IA
81,7 % de 4 645
Sites de l’UE avec un llms.txt valide
9,4 %

IA & GEO : optimiser pour la recherche pilotée par l'IA

On appelle « generative engine optimisation » (GEO) le fait de chercher à être cité dans les réponses d’IA — AI Overviews et mode IA de Google, recherche de ChatGPT, Claude, Perplexity, Copilot. Beaucoup de ce qui se vend sous ce nom n’a aucune base documentée. Ce guide sépare ce que documentent les opérateurs de ce qui relève de la supposition, et donne les chiffres de notre propre étude des sites de l’UE.

Ce que les opérateurs documentent vraiment

Google. Sa documentation sur les fonctionnalités d’IA indique qu’il n’y a pas d’exigence supplémentaire pour apparaître dans les AI Overviews ou le mode IA, ni d’optimisation particulière : la page doit être indexée et pouvoir s’afficher dans la recherche avec un extrait. Les bonnes pratiques habituelles s’appliquent — autoriser l’exploration, relier les pages entre elles, garder le contenu important en texte, garder des données structurées cohérentes avec la page visible. Aucun fichier texte pour l’IA ni balisage spécial n’est nécessaire.

OpenAI, Anthropic, Perplexity. Chacun utilise des robots distincts pour des usages distincts, et chacun indique que ses robots respectent robots.txt :

OpérateurRobot de recherche / réponseRécupération à la demande d’un utilisateurRobot d’entraînement
OpenAIOAI-SearchBotChatGPT-UserGPTBot
AnthropicClaude-SearchBotClaude-UserClaudeBot
PerplexityPerplexityBotPerplexity-User—
GoogleGooglebot (recherche, AI Overviews, mode IA)—Google-Extended (jeton de contrôle, pas un robot)

La distinction importante : bloquer un robot d’entraînement ne vous retire pas de la recherche par IA, bloquer un robot de recherche si. Si vous voulez par exemple être cité dans la recherche de ChatGPT, OAI-SearchBot doit être autorisé ; GPTBot peut être bloqué indépendamment. Google-Extended contrôle l’usage du contenu pour les modèles Gemini et n’affecte pas la présence dans la recherche Google. Copilot de Microsoft s’appuie sur l’index de Bing, donc l’accès de Bingbot compte là.

Étape 1 : l’accès

  1. robots.txt — autorisez les robots de recherche et d’utilisateur par lesquels vous voulez être cité. Les règles suivent la RFC 9309 : le groupe correspondant le plus spécifique s’applique et le chemin correspondant le plus long l’emporte.
  2. Pas de blocage accidentel au niveau du réseau. Une protection anti-robots peut défier des robots que robots.txt autorise ; vérifiez dans les journaux de votre pare-feu ou CDN les requêtes bloquées des robots ci-dessus.
  3. Indexation — aucun noindex sur les pages que vous voulez voir citées.
  4. Autorisation d’extrait — nosnippet, data-nosnippet et max-snippet limitent ce que Google peut afficher, y compris dans les fonctions d’IA. Utilisez-les volontairement, pas par défaut d’un gabarit.

Ce que font aujourd’hui les sites de l’UE

En septembre 2026, nous avons vérifié le robots.txt et le /llms.txt de sites nationaux populaires dans les 27 pays de l’UE — jusqu’à 200 par pays, issus de la liste Chrome UX Report d’août 2026. Sur les 4 645 sites que nous avons pu mesurer :

ConstatPart des sites
Ne bloquent aucun robot d’IA81,7 %
Bloquent au moins un robot d’entraînement16,5 %
Bloquent au moins un robot de recherche ou d’utilisateur IA10,1 %
Bloquent tous les robots de recherche et d’utilisateur IA4,3 %
Bloquent GPTBot13,8 %
Bloquent OAI-SearchBot6,7 %
Publient un /llms.txt valide (sur 4 260 vérifiés)9,4 %

Deux leçons. La plupart des sites ne bloquent rien : l’accès est rarement le problème. Et ceux qui bloquent visent plus souvent les robots d’entraînement que ceux de recherche, ce qui correspond à la distinction ci-dessus. Notre étude « Blocage des robots d’IA sur les sites de l’UE » donne les chiffres par pays et par robot, ainsi que la méthode.

Étape 2 : mériter d’être cité

Les réponses d’IA citent des pages qui répondent clairement à une question et inspirent confiance. Rien de tout cela n’est un facteur de classement secret ; c’est ce que demandent de toute façon les recommandations de Google sur le contenu utile :

  • La réponse d’abord. Donnez la réponse dans les premières lignes, puis expliquez. Un lecteur qui survole — humain ou machine — doit la trouver sans défiler.
  • Une page, une question. Les pages qui mêlent plusieurs sujets sont plus difficiles à citer.
  • Des faits sourcés. Des chiffres datés avec un lien vers leur origine ; des sources primaires plutôt que des résumés.
  • Des tableaux et des listes pour les données qui seraient sinon noyées dans le texte.
  • De l’information originale. Vos propres mesures, exemples et expérience sont ce qu’une réponse d’IA ne trouve pas ailleurs — et la raison de vous citer.
  • Une responsabilité et des dates claires. Qui publie la page, comment elle a été produite et quand elle a changé en substance pour la dernière fois.

Ce que font — et ne font pas — llms.txt et les données structurées

llms.txt est une proposition de fichier Markdown à l’adresse /llms.txt qui oriente les modèles de langage vers les pages clés d’un site. Il est rapide à publier et sans danger, mais aucun grand opérateur de recherche par IA ne documente le lire, et Google indique qu’aucun fichier de ce type n’est nécessaire. Considérez-le comme facultatif ; seuls 9,4 % des sites de l’UE mesurés en ont un valide.

Les données structurées (JSON-LD avec des types schema.org) aident les moteurs à comprendre les entités d’une page — une organisation, un produit, un article — et doivent correspondre au contenu visible. Elles ne font pas entrer à elles seules une page dans les réponses d’IA.

Mesurer

Il n’existe pas de rapport complet des citations par l’IA. Ce que vous pouvez voir : dans la Search Console, les clics issus des AI Overviews et du mode IA sont comptés dans le rapport Performances avec les résultats web ; les visites venant de ChatGPT, Perplexity, Copilot et assistants similaires apparaissent comme sites référents dans vos statistiques ; et les journaux du serveur montrent quels robots d’IA ont récupéré quelles pages. Méfiez-vous des outils qui promettent un « score de visibilité IA » complet sur tous les assistants.

Vérifier avec RankProof

Le contrôle de préparation à l’IA de RankProof ne note que les signaux documentés par les opérateurs : si les robots de recherche et d’utilisateur IA (ainsi que Googlebot et Bingbot) peuvent lire la page, si elle est indexable et si des réglages d’extrait la bloquent. Les options — llms.txt, version Markdown, données structurées — sont listées mais non notées. Le vérificateur robots.txt montre quels robots vos règles autorisent, le générateur robots.txt écrit des règles par groupe de robots et le générateur llms.txt rédige le fichier si vous décidez d’en publier un.

Prêt à mieux vous classer ?

Utilisez les outils gratuits de RankProof pour améliorer votre positionnement et progresser vers la conformité européenne en matière d'accessibilité.

Essayer le scan gratuit