Les guides GEO disponibles disent quoi faire ; la grille pour mesurer où l'on en est manque. Le problème est technique avant d'être éditorial : un moteur IA ne vous citera pas si son robot ne vous lit pas, et chaque éditeur a son robot, son tag et son délai. Ouvrez votre robots.txt : c'est là que l'audit commence, pas dans la rédaction des passages.
Un audit de citabilité IA se conduit en cinq blocs mesurables : l'accès des robots IA dans le robots.txt (GPTBot pour l'entraînement, OAI-SearchBot pour la recherche ChatGPT, réglages indépendants), le délai de prise en compte des changements (environ 24 heures chez OpenAI), la présence d'un llms.txt (la spécification en est à la version 2), le format des passages citables, et la cohérence des entités. Chacun se vérifie sans outil payant, sur son propre domaine.
Bloc 1 : les robots, un par un#
OpenAI documente deux tags distincts dans son fichier officiel : « OpenAI uses OAI-SearchBot and GPTBot robots.txt tags to enable webmasters to manage how their sites and content work with AI ». La nuance est la première à comprendre, parce qu'elle se rate facilement : « Each setting is independent of the others ». Vous pouvez autoriser OAI-SearchBot pour apparaître dans les résultats de recherche ChatGPT tout en refusant GPTBot, ce qui signifie, mot pour mot dans la documentation, que le contenu crawlé « should not be used for training OpenAI's generative AI foundation models ».
L'inverse aussi se vérifie : un site qui bloque OAI-SearchBot disparaît des réponses de recherche de ChatGPT, même s'il reste atteignable comme lien de navigation (« Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers, though can still appear as navigational links »). Côté Google, le robots.txt reste la porte d'entrée standard : il « indique aux robots d'exploration d'un moteur de recherche les URL auxquelles il peut accéder sur votre site ».
Le point de contrôle concret : votre robots.txt distingue-t-il bien les deux usages, entraînement et recherche, ou applique-t-il un blocage global qui vous coûte la visibilité ? Le détail bot par bot, ClaudeBot compris, est déjà documenté ici.
Bloc 2 : les délais, pas les vœux#
Un changement de robots.txt n'est pas immédiat. OpenAI l'écrit noir sur blanc : « it can take ~24 hours from a site's robots.txt update for our systems to adjust ». Un audit qui ne vérifie pas le délai réel de recrawl mesure une intention, pas un état. La documentation recommande aussi d'autoriser les plages IP publiées par l'éditeur, pas seulement le tag : les configurations CDN laissent ce point passer.
Bloc 3 : llms.txt, la version 2#
Le fichier llms.txt est né en 2024 comme « a proposal to standardise on using an llms.txt file to provide information to help agents use a website ». Deux ans plus tard, la spécification est passée en v2 et le texte de référence assume le changement d'époque : « When this proposal was first written in 2024, this was largely a prediction. Today it is routine », avec des milliers de sites publiant un llms.txt. Le point d'audit n'est pas la foi dans le standard, c'est l'écart : votre site en publie-t-il un, et dans quelle version ? L'historique du standard et son adoption mesurée sont traités dans l'article dédié.
Bloc 4 : le format des passages#
Un robot qui lit ne suffit pas : encore faut-il que le passage cité tienne debout tout seul. La méthode de découpage en passages autonomes est détaillée dans l'article du réseau, et le guide GEO complet pose le cadre. À l'audit, le test est simple : prenez vos trois pages les plus visitées, isolez-en les paragraphes répondant à une question, et vérifiez qu'aucun ne dépend d'une phrase précédente pour être compris.
La grille, en une table#
| Bloc | Point à vérifier | Où le vérifier | Source officielle |
|---|---|---|---|
| Accès entraînement | Tag GPTBot dans robots.txt | Racine du domaine | platform.openai.com/docs/bots |
| Accès recherche | Tag OAI-SearchBot | Racine du domaine | platform.openai.com/docs/bots |
| Délai | Changement robots.txt effectif sous ~24 h | Logs serveur, Crawl Stats | platform.openai.com/docs/bots |
| IP | Plages publiées autorisées côté CDN | Configuration CDN | platform.openai.com/docs/bots |
| llms.txt | Fichier v2 présent et à jour | /llms.txt | llmstxt.org |
| Passages | Réponses autonomes, sans anaphore | Pages prioritaires | méthode interne |
| Entités | Balisage schema cohérent | Search Console | Google Search Central |
Ce que la grille ne mesure pas#
Elle mesure l'accès et la forme, pas la décision du moteur de vous citer. Un site parfaitement audible peut rester invisible si son contenu ne dépasse pas ce que le modèle sait déjà ; le guide GEO traite cette partie éditoriale, et l'audit SEO classique en 50 points couvre l'hygiène technique qui reste la base de tout. Les deux checklists se complètent sans s'absorber : l'audit SEO ne dit rien des robots IA, l'audit GEO ne dit rien de votre maillage.
Mon ordre de passage, discutable : robots.txt d'abord, parce qu'un blocage mal calibré annule tout le reste ; llms.txt ensuite ; la refonte des passages en dernier, parce qu'elle est la plus coûteuse en temps et qu'elle ne sert à rien si la porte est fermée.
FAQ#
Faut-il bloquer GPTBot pour protéger son contenu ?#
Cela dépend de ce que vous voulez garder. Bloquer GPTBot exclut votre contenu de l'entraînement des modèles OpenAI, pas de la recherche : OAI-SearchBot reste un réglage indépendant, et l'autoriser maintient votre visibilité dans les réponses de recherche ChatGPT.
Le llms.txt remplace-t-il le robots.txt ?#
Non. Le robots.txt contrôle l'accès des robots, le llms.txt est une proposition de standard pour aider les agents à comprendre un site. Les deux coexistent, et l'audit vérifie les deux séparément.
Combien de temps avant qu'un changement de robots.txt soit effectif chez OpenAI ?#
Environ 24 heures, selon la documentation officielle de l'éditeur. C'est le délai à intégrer dans toute procédure d'audit, sous peine de conclure sur une intention non encore appliquée.
Un audit GEO suffit-il à être cité par les IA ?#
Non. Il vérifie l'accès et le format. La citation dépend aussi de la valeur informationnelle du contenu face à ce que le modèle connaît déjà, ce que traite le volet éditorial du GEO.
Sources#
- OpenAI - Overview of OpenAI Crawlers, consulté le 2026-10-07
- llmstxt.org - The /llms.txt file, v2, consulté le 2026-10-07
- Google Search Central - Présentation du fichier robots.txt, consulté le 2026-10-07





