Robots.txt 2026 : bloquer ou autoriser GPTBot, ClaudeBot, PerplexityBot ?
Bloquer ou autoriser GPTBot, ClaudeBot et PerplexityBot dans le robots.txt n’a rien d’un réglage technique anodin : c’est un arbitrage business qui engage la visibilité du site dans les réponses de ChatGPT, Claude et Perplexity pour les années à venir. Tout dépend de ce qui fait vivre le site, le contenu lui-même ou le trafic qu’il attire. Et la donnée 2026 montre une chose : la majorité des sites n’a pas encore tranché, ils bloquent ou autorisent par défaut, sans stratégie derrière.
GPTBot, ClaudeBot, PerplexityBot : trois bots, trois logiques
Les regrouper sous l’étiquette « bots IA » fait perdre l’essentiel. Leur volume de crawl, leur usage des données et surtout ce qu’ils rendent en trafic diffèrent du tout au tout.
Sur le réseau Cloudflare, en juin 2025, GPTBot représentait 28,97 % du trafic de crawl généré par les sites, ClaudeBot 18,80 %, et Meta-ExternalAgent 22,16 % (Cloudflare). Trois acteurs qui aspirent une part massive de la bande passante de crawl, loin devant la plupart des autres bots du marché.
Le vrai clivage se joue ailleurs : dans le ratio crawl-to-refer, autrement dit combien de pages un bot aspire pour chaque visiteur qu’il renvoie ensuite sur le site. Le Cloudflare Radar Year in Review 2025 donne des chiffres qui devraient orienter toute décision de blocage. Anthropic culmine à environ 500 000 pages crawlées pour 1 visiteur renvoyé en début d’année, puis se stabilise entre 25 000:1 et 100 000:1 après mai. OpenAI plafonne à 3 700:1 en mars. Perplexity, à l’inverse, se maintient sous 400:1 la majeure partie de l’année et passe sous 200:1 à partir de septembre (Cloudflare Radar).
Autoriser ClaudeBot revient, en pratique, à donner accès au contenu contre un retour de trafic quasi nul. Autoriser PerplexityBot rapporte, proportionnellement, bien plus. Ce n’est pas un jugement sur Anthropic, mais un ratio coût-bénéfice qui mérite de peser autant que n’importe quel arbitrage d’acquisition payante.
Le précédent Perplexity : autoriser ne garantit rien
Un robots.txt propre part du principe que le bot en face respecte la règle posée. Ce principe a pris un coup en août 2025.
Cloudflare a retiré Perplexity de son programme de bots vérifiés et s’est mis à le bloquer activement après avoir constaté que ses crawlers contournaient les restrictions : rotation sur des IP non déclarées réparties sur plusieurs ASN, et usurpation d’un user-agent Chrome sur Mac pour se faire passer pour un visiteur humain plutôt qu’un bot. Perplexity a contesté la qualification de « crawler malveillant », plaidant que ses agents pilotés par l’utilisateur relèvent d’une autre logique.
Qui a raison sur le fond importe peu ici. L’épisode démontre surtout qu’un Disallow dans le robots.txt n’est qu’une déclaration d’intention. Bloquer un bot appelle une vérification côté logs serveur, pas une confiance aveugle dans le fichier.
Ce que font réellement les sites, pas ce qu’ils devraient faire
Avant de choisir un camp, il faut savoir que la plupart des sites n’ont pas de politique vis-à-vis des bots IA.
Seuls 37 % des 10 000 domaines les plus visités disposent d’un fichier robots.txt tout court. Et parmi ceux qui en ont un, GPTBot n’y figure en Disallow que dans 7,8 % des cas (Cloudflare). Le blocage massif dont parlent certains articles alarmistes concerne, dans les faits, une minorité de sites.
La presse a bougé plus vite que le reste du web. Une étude du Reuters Institute (Oxford) portant sur 150 sites d’actualité dans 10 pays montrait déjà fin 2023 que 48 % des principaux médias bloquaient GPTBot, et 24 % Google-Extended, avec de fortes disparités géographiques : 79 % aux États-Unis contre 20 % au Mexique et en Pologne (Reuters Institute). Logique : leur contenu est le produit, pas un simple support d’acquisition.
La tendance progresse malgré tout. Une analyse des robots.txt du réseau Cloudflare datée du 30 mars 2026, sur 4 047 fichiers, situe désormais la mention de GPTBot dans 13,8 % des fichiers et son Disallow dans 5,52 % des directives ciblant l’IA, ClaudeBot suivant de près avec 4,88 % (TechnologyChecker, données Cloudflare Radar). Le mouvement existe, il concerne encore une minorité de sites, et de façon très inégale selon les secteurs.
La grille de décision : trancher selon le modèle économique
Le bon arbitrage se construit à partir d’une seule question, celle qu’on pose systématiquement en audit : qu’est-ce qui génère le revenu, le contenu consulté ou le trafic qu’il attire ?
Le contenu comme produit
Un média, un site d’abonnement, une base de données propriétaire vend l’accès à l’information elle-même. Toute page aspirée par un bot d’entraînement, sans contrepartie ni citation garantie, ressemble à une fuite de valeur. Bloquer GPTBot et ClaudeBot en mode entraînement, à l’image des médias étudiés par le Reuters Institute, correspond le mieux à ce modèle.
Le contenu comme canal d’acquisition
Une agence, un site e-commerce ou un éditeur SaaS B2B entretient un rapport très différent au contenu : il sert à attirer, convaincre, être cité. Bloquer les bots IA revient alors à s’exclure soi-même des réponses générées par ChatGPT, Claude ou Perplexity, un canal d’acquisition en pleine expansion que la GEO cherche justement à exploiter. Un profil de liens solide compte double dans cette équation : il conditionne le classement Google autant que la citabilité par les LLM.
Le cas intermédiaire : trancher bot par bot, page par page
Rien n’impose un choix binaire à l’échelle du site entier. Cloudflare propose par exemple de restreindre les bots IA uniquement sur les pages monétisées par publicité, en laissant le reste ouvert au crawl. La même logique s’applique à la distinction entre bots d’entraînement (GPTBot, ClaudeBot) et bots de réponse mobilisés en temps réel lors d’une requête utilisateur, ces derniers se comportant beaucoup plus comme un moteur de recherche classique. Autoriser les seconds tout en restreignant les premiers fait partie des options que trop peu de sites explorent. Les leviers pratiques pour apparaître dans les LLM sont détaillés dans notre article.
Mettre la décision en œuvre sans se tromper de bot
Une fois l’arbitrage posé, l’exécution technique tient en une règle simple : une directive User-agent par bot, avec son Disallow ou son Allow propre, plutôt qu’une règle générique visant tous les crawlers IA d’un coup. Confondre GPTBot avec OAI-SearchBot, ou ClaudeBot avec un futur bot de réponse d’Anthropic, revient à bloquer ce qu’on voulait garder, et inversement. L’article robots.txt pour WordPress, Prestashop et Magento explique la syntaxe et les pièges propres à chaque CMS.
Un point mérite d’ailleurs d’être distingué du robots.txt : le fichier llms.txt, souvent confondu avec lui, ne joue quasiment aucun rôle dans la citation par les IA génératives, contrairement au robots.txt qui, lui, contrôle réellement l’accès.
Dernier réflexe, et pas des moindres après l’épisode Perplexity : vérifier dans les logs serveur que les bots respectent la règle posée, plutôt que de se fier au fichier seul.
La décision robots.txt est donc un arbitrage propre à chaque bot et à chaque page, mais surtout au modèle économique du site, à réévaluer aussi souvent que les ratios de crawl-to-refer évoluent.
Chaque semaine, recevez les meilleurs articles growth résumés et découvrez un outil unique pour booster votre business. Profitez aussi d’outils gratuits et de webinars exclusifs.
Commentaires