Outils / Robots.txt et robots d'IA
Outil gratuit · robots d'IA
Robots.txt IA : vérifiez quels robots d'IA votre site laisse passer
Un robots.txt se relit sans rien voir : une ligne ajoutée pour un robot peut en libérer un autre, et une règle écrite en tête peut rendre les suivantes inopérantes pour certains lecteurs. Collez le vôtre ci-dessous : la page vous dit, robot par robot, ce qui passe et ce qui est bloqué, et pourquoi.
Le robots.txt indique à chaque robot, par son nom, les parties d'un site qu'il peut explorer. Pour les robots d'IA, il sépare trois décisions que l'on confond souvent : servir à entraîner un modèle, être trouvé par la recherche d'un assistant, et être lu quand un utilisateur pose une question.
L'analyseur
Votre robots.txt bloque-t-il les robots d'IA ?
Ouvrez https://votresite.fr/robots.txt dans votre navigateur, copiez tout le texte et collez-le ici. L'analyse se fait dans votre navigateur : rien n'est envoyé, rien n'est enregistré. Le fichier d'exemple ci-dessous contient volontairement un piège.
Analyse en cours.
| Robot | Éditeur | Rôle | Racine / | Chemin testé | Groupe lu |
|---|
Règles appliquées (RFC 9309, norme du robots.txt) : le robot lit le groupe qui porte son nom, sans tenir compte des majuscules ; s'il n'en existe aucun, il lit le groupe * ; s'il n'y a ni l'un ni l'autre, tout est permis. Plusieurs groupes au même nom s'additionnent. Dans le groupe retenu, la règle dont le chemin est le plus long l'emporte, et à longueur égale Allow gagne. * remplace n'importe quelle suite de caractères, $ marque la fin de l'adresse. Seule exception programmée : Apple indique qu'Applebot suit les règles de Googlebot quand le fichier ne le nomme pas. L'outil lit le fichier, il ne vérifie pas ce que votre hébergeur ou votre pare-feu laissent réellement passer.
Les robots, selon leurs éditeurs
Quels robots d'IA lisent votre robots.txt, et à quoi servent-ils ?
Chaque rôle est repris de la documentation officielle de l'éditeur, relue le 21/09/2026. Un même éditeur envoie souvent plusieurs robots : les bloquer n'a pas du tout les mêmes conséquences.
Faites défiler le tableau horizontalement
| Robot | Éditeur | À quoi il sert | Si vous le bloquez |
|---|---|---|---|
| GPTBot | OpenAI | Collecter des contenus qui peuvent servir à entraîner les modèles d'OpenAI | Vos contenus ne doivent pas servir à l'entraînement ; la recherche de ChatGPT n'est pas concernée |
| OAI-SearchBot | OpenAI | Faire apparaître des sites dans les fonctions de recherche de ChatGPT | Votre site n'apparaît plus dans les réponses de recherche, sauf éventuellement comme simple lien |
| ChatGPT-User | OpenAI | Visiter une page quand un utilisateur de ChatGPT pose une question | OpenAI précise que les règles du robots.txt peuvent ne pas s'appliquer, l'action venant d'un utilisateur |
| OAI-AdsBot | OpenAI | Vérifier les pages soumises comme annonces dans ChatGPT ; pas d'entraînement | Ne concerne que les annonceurs de ChatGPT : il ne visite que les pages soumises en publicité |
| Googlebot | Explorer pour la recherche Google, AI Overviews et Mode IA compris | Vous sortez de la recherche Google, réponses IA comprises | |
| Google-Extended | Jeton de contrôle, sans robot distinct : entraînement des futurs modèles Gemini et ancrage des réponses de l'application Gemini | Aucun effet sur la recherche Google ni sur le classement, selon Google | |
| PerplexityBot | Perplexity | Faire apparaître et lier des sites dans les résultats de Perplexity ; pas d'entraînement | Votre site ne peut plus être proposé dans ses résultats |
| Perplexity-User | Perplexity | Visiter une page pour répondre à la question d'un utilisateur | Perplexity indique que ce robot ignore généralement le robots.txt |
| ClaudeBot | Anthropic | Collecter des contenus qui peuvent servir à entraîner les modèles | Vos futurs contenus sont exclus des jeux d'entraînement. Anthropic accepte aussi Crawl-delay pour ralentir ce robot |
| Claude-SearchBot | Anthropic | Améliorer la qualité des résultats de recherche de Claude | Votre contenu n'est plus indexé pour sa recherche |
| Claude-User | Anthropic | Accéder à une page quand un utilisateur pose une question à Claude | Claude ne récupère plus vos pages pour répondre |
| MistralAI-Training | Mistral | Constituer des jeux de données pour entraîner les modèles de Mistral | Vos contenus sont exclus de ces jeux de données |
| MistralAI-Index | Mistral | Indexer le web pour la recherche de Mistral, qui sert son assistant Vibe (anciennement Le Chat) ; pas d'entraînement | Votre site sort de cet index |
| MistralAI-User | Mistral | Visiter une page quand un utilisateur de Vibe pose une question | Ces requêtes ne peuvent plus viser votre site |
| Bingbot | Microsoft | Explorer pour le moteur Bing ; Microsoft suit dans Bing Webmaster Tools les citations de pages dans Copilot et dans les résumés IA de Bing | Vous sortez de Bing ; Microsoft indique respecter le robots.txt pour ses réponses IA aussi |
| Applebot | Apple | Recherche intégrée à Siri, Spotlight et Safari ; ses données peuvent aussi entraîner les modèles d'Apple | Vous sortez de ces résultats. Sans groupe à son nom, il suit celui de Googlebot |
| Applebot-Extended | Apple | Jeton de contrôle, qui n'explore rien : usage des pages pour entraîner les modèles d'Apple | Vos pages restent dans les résultats d'Apple mais sortent de l'entraînement |
| CCBot | Common Crawl | Constituer une archive ouverte du web, accessible à tous | Vos pages n'entrent plus dans cette archive |
OpenAI et Perplexity indiquent tous deux qu'un changement de robots.txt peut prendre jusqu'à environ 24 heures pour être pris en compte.
Ce que cela change pour vous
Faut-il bloquer les robots d'IA ?
La question n'est pas « pour ou contre l'IA ». Elle est de savoir, robot par robot, ce que vous refusez. Refuser l'entraînement (GPTBot, ClaudeBot, MistralAI-Training, Google-Extended, Applebot-Extended) est un choix défendable qui ne vous retire, selon les éditeurs, d'aucun résultat de recherche. Bloquer un robot de recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot, MistralAI-Index) vous retire des réponses de l'assistant concerné, là où vos prospects posent de plus en plus leurs questions.
C'est ce que nous vérifions en premier chez une entreprise qui veut être citée : un fichier écrit il y a deux ans pour « se protéger de l'IA » bloque souvent les robots de recherche en même temps que ceux d'entraînement. Le robots.txt n'est que la porte d'entrée de notre méthode AI Everywhere, qui rend une entreprise trouvable sur Google, dans les réponses IA et sur YouTube ; le travail de fond, contenu et sources, fait l'objet de notre accompagnement d'agence GEO.
Pièges vérifiés
Pourquoi un robots.txt qui semble juste bloque le mauvais robot
Les deux premiers pièges, nous les avons trouvés en passant un fichier dans un analyseur, robot par robot. Ils étaient invisibles à la relecture.
Un groupe à son nom remplace le groupe *
Dès qu'un robot a un groupe à son nom, il ne lit plus du tout le groupe *. Dans le fichier d'exemple de l'analyseur, OAI-SearchBot peut explorer /panier/ alors que le groupe * l'interdit. Toutes les exclusions doivent être répétées dans chaque groupe nommé.
Une ligne inutile qui annule les suivantes
La norme veut que la règle la plus longue gagne, et Google l'applique. Mais un robot qui s'arrête à la première règle rencontrée lira Allow: / et ignorera les Disallow placés dessous. Retirez cette ligne : ce qui n'est pas interdit est déjà permis.
Il ne vous retire pas des AI Overviews
Google écrit que ce jeton n'a aucun effet sur l'inclusion dans la recherche. Les AI Overviews et le Mode IA dépendent de Googlebot : bloquer Google-Extended limite l'entraînement et l'ancrage de Gemini, pas votre présence dans les réponses de la recherche. Pour en sortir, Google propose depuis le 31/08/2026 un réglage de la Search Console. Voir les AI Overviews de Google.
Le pare-feu décide aussi
Un robots.txt ouvert ne sert à rien si l'hébergeur ou un pare-feu refuse les robots. OpenAI, Perplexity, Anthropic, Mistral et Apple publient les adresses ou les méthodes qui permettent d'identifier leurs vrais robots : c'est à partir de ces listes qu'on autorise, pas du seul nom affiché. Voir aussi notre page sur le SEO technique.
Ce que nous ne promettons pas
Un robots.txt ouvert rend la citation possible, pas certaine. Aucun éditeur ne publie de classement, et les réponses d'un assistant changent d'une question à l'autre et d'un passage à l'autre. Nous nous engageons sur les vérifications et une mesure répétée, jamais sur une place.
Ressource offerte
Le robots.txt n'est que la première case de la liste
Checklist de citabilité IA (GEO)
Pour vérifier, après l'accès des robots, ce qui fait qu'une page est reprise par une réponse.
- Accès des robots OAI-SearchBot, GPTBot et Google-Extended, avec la documentation officielle citée
- Réponse définitionnelle en tête, questions réelles en titres, entités nommées, preuves datées
- Données structurées et présence hors site
- La méthode de test : les questions à poser aux assistants, sur deux formulations, et comment lire le résultat
Accès immédiat après le formulaire, sans attendre d'email.
Vos informations servent à vous donner accès à la ressource et, si vous le souhaitez, à échanger sur votre acquisition. Aucune revente. Voir notre politique de confidentialité.
Questions fréquentes
Robots.txt et IA : les questions qui reviennent
Comment bloquer ChatGPT dans le robots.txt ?
Cela dépend de ce que vous voulez bloquer. Pour refuser l'entraînement : un groupe User-agent: GPTBot avec Disallow: /. Pour sortir de la recherche de ChatGPT : le même groupe pour OAI-SearchBot, en sachant que vous disparaissez alors de ses réponses. ChatGPT-User, déclenché par un utilisateur, peut ne pas respecter ces règles selon OpenAI.
Bloquer GPTBot retire-t-il un site de ChatGPT ?
Non. Selon OpenAI, chaque réglage est indépendant : GPTBot concerne l'entraînement, OAI-SearchBot la recherche. Vous pouvez refuser l'un et accepter l'autre.
Faut-il bloquer Google-Extended pour ne pas apparaître dans les AI Overviews ?
Ce n'est pas le bon levier : Google indique que Google-Extended n'a pas d'effet sur l'inclusion dans la recherche. Depuis le 31/08/2026, la Search Console propose un réglage dédié, Paramètres puis « IA générative dans la Recherche », qui exclut le site des Aperçus IA et du Mode IA sans toucher aux résultats classiques. Google précise que l'exclusion prend généralement quelques jours et que vous perdez alors le trafic venu de ces réponses.
Où trouver le robots.txt de son site ?
À la racine du domaine : https://votresite.fr/robots.txt. Chaque sous-domaine a le sien. S'il n'existe pas, aucun robot n'est bloqué par ce biais.
Combien de temps faut-il pour qu'un changement soit pris en compte ?
OpenAI et Perplexity parlent d'environ 24 heures pour leurs systèmes. Les autres éditeurs ne publient pas de délai. Retestez le fichier en ligne après chaque modification.
Les robots d'IA respectent-ils vraiment le robots.txt ?
Les éditeurs cités ici présentent le robots.txt comme le moyen de contrôler leurs robots automatiques. Les exceptions sont écrites dans leur documentation : ChatGPT-User et Perplexity-User, qui agissent pour un utilisateur. Des robots peuvent aussi usurper un nom : les listes d'adresses publiées par les éditeurs servent à vérifier.
La prochaine étape
Savoir si les assistants peuvent citer votre site
Avant l'appel, nous lisons votre robots.txt, les pages qui devraient répondre aux questions de vos clients et ce que les assistants en disent aujourd'hui, sans aucun de vos accès. Vous gardez ce constat, qu'on travaille ensemble ou non.
Sources. Rôles et délais des robots : documentation officielle d'OpenAI (Overview of OpenAI Crawlers), de Perplexity (Perplexity Crawlers), d'Anthropic (centre d'aide Claude, article sur l'exploration du web), de Mistral (Mistral crawlers), de Google (liste des robots d'exploration courants, fiche Google-Extended, et guide « Fonctionnalités d'IA et votre site Web »), d'Apple (About Applebot), de Common Crawl (CCBot) et de Microsoft (blog Bing Webmaster sur le rapport AI Performance), toutes consultées le 21/09/2026. Règles de lecture : RFC 9309 (Robots Exclusion Protocol), sections 2.2.1 à 2.2.3. L'analyseur a été testé sur des cas qui doivent passer et des cas qui doivent échouer avant sa mise en ligne. Il lit le fichier collé et ne mesure ni l'accès réel ni une citation.
Rank-Brain · SIRET 98885991400018 · Le Bouscat, France · contact@rank-brain.fr
