Outils / Robots.txt et robots d'IA

Outil gratuit · robots d'IA

Robots.txt IA : vérifiez quels robots d'IA votre site laisse passer

Un robots.txt se relit sans rien voir : une ligne ajoutée pour un robot peut en libérer un autre, et une règle écrite en tête peut rendre les suivantes inopérantes pour certains lecteurs. Collez le vôtre ci-dessous : la page vous dit, robot par robot, ce qui passe et ce qui est bloqué, et pourquoi.

Réserver un diagnostic gratuit30 minutes. Nous analysons votre site avant l'appel, sans aucun accès.

Le robots.txt indique à chaque robot, par son nom, les parties d'un site qu'il peut explorer. Pour les robots d'IA, il sépare trois décisions que l'on confond souvent : servir à entraîner un modèle, être trouvé par la recherche d'un assistant, et être lu quand un utilisateur pose une question.

L'analyseur

Votre robots.txt bloque-t-il les robots d'IA ?

Ouvrez https://votresite.fr/robots.txt dans votre navigateur, copiez tout le texte et collez-le ici. L'analyse se fait dans votre navigateur : rien n'est envoyé, rien n'est enregistré. Le fichier d'exemple ci-dessous contient volontairement un piège.

Analyse en cours.

    RobotÉditeurRôleRacine /Chemin testéGroupe lu

    Règles appliquées (RFC 9309, norme du robots.txt) : le robot lit le groupe qui porte son nom, sans tenir compte des majuscules ; s'il n'en existe aucun, il lit le groupe * ; s'il n'y a ni l'un ni l'autre, tout est permis. Plusieurs groupes au même nom s'additionnent. Dans le groupe retenu, la règle dont le chemin est le plus long l'emporte, et à longueur égale Allow gagne. * remplace n'importe quelle suite de caractères, $ marque la fin de l'adresse. Seule exception programmée : Apple indique qu'Applebot suit les règles de Googlebot quand le fichier ne le nomme pas. L'outil lit le fichier, il ne vérifie pas ce que votre hébergeur ou votre pare-feu laissent réellement passer.

    Les robots, selon leurs éditeurs

    Quels robots d'IA lisent votre robots.txt, et à quoi servent-ils ?

    Chaque rôle est repris de la documentation officielle de l'éditeur, relue le 21/09/2026. Un même éditeur envoie souvent plusieurs robots : les bloquer n'a pas du tout les mêmes conséquences.

    Faites défiler le tableau horizontalement

    RobotÉditeurÀ quoi il sertSi vous le bloquez
    GPTBotOpenAICollecter des contenus qui peuvent servir à entraîner les modèles d'OpenAIVos contenus ne doivent pas servir à l'entraînement ; la recherche de ChatGPT n'est pas concernée
    OAI-SearchBotOpenAIFaire apparaître des sites dans les fonctions de recherche de ChatGPTVotre site n'apparaît plus dans les réponses de recherche, sauf éventuellement comme simple lien
    ChatGPT-UserOpenAIVisiter une page quand un utilisateur de ChatGPT pose une questionOpenAI précise que les règles du robots.txt peuvent ne pas s'appliquer, l'action venant d'un utilisateur
    OAI-AdsBotOpenAIVérifier les pages soumises comme annonces dans ChatGPT ; pas d'entraînementNe concerne que les annonceurs de ChatGPT : il ne visite que les pages soumises en publicité
    GooglebotGoogleExplorer pour la recherche Google, AI Overviews et Mode IA comprisVous sortez de la recherche Google, réponses IA comprises
    Google-ExtendedGoogleJeton de contrôle, sans robot distinct : entraînement des futurs modèles Gemini et ancrage des réponses de l'application GeminiAucun effet sur la recherche Google ni sur le classement, selon Google
    PerplexityBotPerplexityFaire apparaître et lier des sites dans les résultats de Perplexity ; pas d'entraînementVotre site ne peut plus être proposé dans ses résultats
    Perplexity-UserPerplexityVisiter une page pour répondre à la question d'un utilisateurPerplexity indique que ce robot ignore généralement le robots.txt
    ClaudeBotAnthropicCollecter des contenus qui peuvent servir à entraîner les modèlesVos futurs contenus sont exclus des jeux d'entraînement. Anthropic accepte aussi Crawl-delay pour ralentir ce robot
    Claude-SearchBotAnthropicAméliorer la qualité des résultats de recherche de ClaudeVotre contenu n'est plus indexé pour sa recherche
    Claude-UserAnthropicAccéder à une page quand un utilisateur pose une question à ClaudeClaude ne récupère plus vos pages pour répondre
    MistralAI-TrainingMistralConstituer des jeux de données pour entraîner les modèles de MistralVos contenus sont exclus de ces jeux de données
    MistralAI-IndexMistralIndexer le web pour la recherche de Mistral, qui sert son assistant Vibe (anciennement Le Chat) ; pas d'entraînementVotre site sort de cet index
    MistralAI-UserMistralVisiter une page quand un utilisateur de Vibe pose une questionCes requêtes ne peuvent plus viser votre site
    BingbotMicrosoftExplorer pour le moteur Bing ; Microsoft suit dans Bing Webmaster Tools les citations de pages dans Copilot et dans les résumés IA de BingVous sortez de Bing ; Microsoft indique respecter le robots.txt pour ses réponses IA aussi
    ApplebotAppleRecherche intégrée à Siri, Spotlight et Safari ; ses données peuvent aussi entraîner les modèles d'AppleVous sortez de ces résultats. Sans groupe à son nom, il suit celui de Googlebot
    Applebot-ExtendedAppleJeton de contrôle, qui n'explore rien : usage des pages pour entraîner les modèles d'AppleVos pages restent dans les résultats d'Apple mais sortent de l'entraînement
    CCBotCommon CrawlConstituer une archive ouverte du web, accessible à tousVos pages n'entrent plus dans cette archive

    OpenAI et Perplexity indiquent tous deux qu'un changement de robots.txt peut prendre jusqu'à environ 24 heures pour être pris en compte.

    Ce que cela change pour vous

    Faut-il bloquer les robots d'IA ?

    La question n'est pas « pour ou contre l'IA ». Elle est de savoir, robot par robot, ce que vous refusez. Refuser l'entraînement (GPTBot, ClaudeBot, MistralAI-Training, Google-Extended, Applebot-Extended) est un choix défendable qui ne vous retire, selon les éditeurs, d'aucun résultat de recherche. Bloquer un robot de recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot, MistralAI-Index) vous retire des réponses de l'assistant concerné, là où vos prospects posent de plus en plus leurs questions.

    C'est ce que nous vérifions en premier chez une entreprise qui veut être citée : un fichier écrit il y a deux ans pour « se protéger de l'IA » bloque souvent les robots de recherche en même temps que ceux d'entraînement. Le robots.txt n'est que la porte d'entrée de notre méthode AI Everywhere, qui rend une entreprise trouvable sur Google, dans les réponses IA et sur YouTube ; le travail de fond, contenu et sources, fait l'objet de notre accompagnement d'agence GEO.

    Pièges vérifiés

    Pourquoi un robots.txt qui semble juste bloque le mauvais robot

    Les deux premiers pièges, nous les avons trouvés en passant un fichier dans un analyseur, robot par robot. Ils étaient invisibles à la relecture.

    01 · Groupe nommé

    Un groupe à son nom remplace le groupe *

    Dès qu'un robot a un groupe à son nom, il ne lit plus du tout le groupe *. Dans le fichier d'exemple de l'analyseur, OAI-SearchBot peut explorer /panier/ alors que le groupe * l'interdit. Toutes les exclusions doivent être répétées dans chaque groupe nommé.

    02 · Allow: / en tête

    Une ligne inutile qui annule les suivantes

    La norme veut que la règle la plus longue gagne, et Google l'applique. Mais un robot qui s'arrête à la première règle rencontrée lira Allow: / et ignorera les Disallow placés dessous. Retirez cette ligne : ce qui n'est pas interdit est déjà permis.

    03 · Google-Extended

    Il ne vous retire pas des AI Overviews

    Google écrit que ce jeton n'a aucun effet sur l'inclusion dans la recherche. Les AI Overviews et le Mode IA dépendent de Googlebot : bloquer Google-Extended limite l'entraînement et l'ancrage de Gemini, pas votre présence dans les réponses de la recherche. Pour en sortir, Google propose depuis le 31/08/2026 un réglage de la Search Console. Voir les AI Overviews de Google.

    04 · Au-delà du fichier

    Le pare-feu décide aussi

    Un robots.txt ouvert ne sert à rien si l'hébergeur ou un pare-feu refuse les robots. OpenAI, Perplexity, Anthropic, Mistral et Apple publient les adresses ou les méthodes qui permettent d'identifier leurs vrais robots : c'est à partir de ces listes qu'on autorise, pas du seul nom affiché. Voir aussi notre page sur le SEO technique.

    Ce que nous ne promettons pas

    Un robots.txt ouvert rend la citation possible, pas certaine. Aucun éditeur ne publie de classement, et les réponses d'un assistant changent d'une question à l'autre et d'un passage à l'autre. Nous nous engageons sur les vérifications et une mesure répétée, jamais sur une place.

    Ressource offerte

    Le robots.txt n'est que la première case de la liste

    Checklist de citabilité IA (GEO)

    Pour vérifier, après l'accès des robots, ce qui fait qu'une page est reprise par une réponse.

    • Accès des robots OAI-SearchBot, GPTBot et Google-Extended, avec la documentation officielle citée
    • Réponse définitionnelle en tête, questions réelles en titres, entités nommées, preuves datées
    • Données structurées et présence hors site
    • La méthode de test : les questions à poser aux assistants, sur deux formulations, et comment lire le résultat

    Accès immédiat après le formulaire, sans attendre d'email.

    Vos informations servent à vous donner accès à la ressource et, si vous le souhaitez, à échanger sur votre acquisition. Aucune revente. Voir notre politique de confidentialité.

    Questions fréquentes

    Robots.txt et IA : les questions qui reviennent

    Comment bloquer ChatGPT dans le robots.txt ?

    Cela dépend de ce que vous voulez bloquer. Pour refuser l'entraînement : un groupe User-agent: GPTBot avec Disallow: /. Pour sortir de la recherche de ChatGPT : le même groupe pour OAI-SearchBot, en sachant que vous disparaissez alors de ses réponses. ChatGPT-User, déclenché par un utilisateur, peut ne pas respecter ces règles selon OpenAI.

    Bloquer GPTBot retire-t-il un site de ChatGPT ?

    Non. Selon OpenAI, chaque réglage est indépendant : GPTBot concerne l'entraînement, OAI-SearchBot la recherche. Vous pouvez refuser l'un et accepter l'autre.

    Faut-il bloquer Google-Extended pour ne pas apparaître dans les AI Overviews ?

    Ce n'est pas le bon levier : Google indique que Google-Extended n'a pas d'effet sur l'inclusion dans la recherche. Depuis le 31/08/2026, la Search Console propose un réglage dédié, Paramètres puis « IA générative dans la Recherche », qui exclut le site des Aperçus IA et du Mode IA sans toucher aux résultats classiques. Google précise que l'exclusion prend généralement quelques jours et que vous perdez alors le trafic venu de ces réponses.

    Où trouver le robots.txt de son site ?

    À la racine du domaine : https://votresite.fr/robots.txt. Chaque sous-domaine a le sien. S'il n'existe pas, aucun robot n'est bloqué par ce biais.

    Combien de temps faut-il pour qu'un changement soit pris en compte ?

    OpenAI et Perplexity parlent d'environ 24 heures pour leurs systèmes. Les autres éditeurs ne publient pas de délai. Retestez le fichier en ligne après chaque modification.

    Les robots d'IA respectent-ils vraiment le robots.txt ?

    Les éditeurs cités ici présentent le robots.txt comme le moyen de contrôler leurs robots automatiques. Les exceptions sont écrites dans leur documentation : ChatGPT-User et Perplexity-User, qui agissent pour un utilisateur. Des robots peuvent aussi usurper un nom : les listes d'adresses publiées par les éditeurs servent à vérifier.

    La prochaine étape

    Savoir si les assistants peuvent citer votre site

    Avant l'appel, nous lisons votre robots.txt, les pages qui devraient répondre aux questions de vos clients et ce que les assistants en disent aujourd'hui, sans aucun de vos accès. Vous gardez ce constat, qu'on travaille ensemble ou non.

    Sources. Rôles et délais des robots : documentation officielle d'OpenAI (Overview of OpenAI Crawlers), de Perplexity (Perplexity Crawlers), d'Anthropic (centre d'aide Claude, article sur l'exploration du web), de Mistral (Mistral crawlers), de Google (liste des robots d'exploration courants, fiche Google-Extended, et guide « Fonctionnalités d'IA et votre site Web »), d'Apple (About Applebot), de Common Crawl (CCBot) et de Microsoft (blog Bing Webmaster sur le rapport AI Performance), toutes consultées le 21/09/2026. Règles de lecture : RFC 9309 (Robots Exclusion Protocol), sections 2.2.1 à 2.2.3. L'analyseur a été testé sur des cas qui doivent passer et des cas qui doivent échouer avant sa mise en ligne. Il lit le fichier collé et ne mesure ni l'accès réel ni une citation.