Faut-il bloquer GPTBot, ClaudeBot et PerplexityBot ?

Bloquer les bots

Faut-il bloquer GPTBot, ClaudeBot et PerplexityBot ?



Publié le 9 septembre 2026 · Par Romuald Paris, consultant SEO et visibilite IA (GEO)

Si vous vendez des services et que votre contenu sert à convaincre un prospect, la réponse est non, ne bloquez rien. Le blocage des crawlers IA protège un actif éditorial, pas une plaquette commerciale. Et surtout, tout le monde mélange deux familles de robots qui n’ont rien à voir : ceux qui collectent du texte pour entraîner un modèle, et ceux qui vont lire votre page au moment où un utilisateur pose sa question. Bloquer les premiers coûte peu. Bloquer les seconds vous efface des réponses, purement et simplement. Voici l’arbitrage ligne par ligne, trois robots.txt de référence selon votre profil, et la procédure de vérification qui évite le piège le plus fréquent : un plugin ou un CDN qui écrase votre fichier.

Le constat, en une donnée

Bloquer un crawler IA consiste à interdire, via une directive Disallow dans le fichier robots.txt, l’accès de votre site à un robot identifié par son user-agent (GPTBot, ClaudeBot, PerplexityBot, Google-Extended). Cette interdiction est déclarative : elle repose sur le respect volontaire du protocole par l’éditeur du robot, et non sur un blocage technique.

Une précaution

Le respect du robots.txt est déclaratif : il n’empêche techniquement rien, il exprime une demande que les grands éditeurs annoncent honorer. Les noms de user-agents et leur rôle exact évoluent au rythme des annonces des éditeurs, donc toute liste doit être revérifiée dans leur documentation avant d’être collée en production. Enfin, aucune mesure publique fiable ne permet aujourd’hui de quantifier le trafic ou les citations perdues après un blocage : les raisonnements de cet article portent sur le mécanisme, pas sur un volume.

La décision, en trente secondes

Posez-vous une seule question : est-ce que je vends mon contenu, ou est-ce que mon contenu sert à vendre autre chose ?

Si vous vendez votre contenu, c’est-à-dire si votre chiffre d’affaires vient d’abonnements, de formations en ligne, de publicité au volume de pages vues ou de bases de données éditoriales, alors votre texte est un actif. Bloquer les robots d’entraînement se défend très bien, et ne vous coûte quasiment rien en visibilité si vous laissez entrer les robots de réponse.

Si votre contenu sert à vendre autre chose, ce qui est le cas de la quasi-totalité des PME, des cabinets, des artisans, des agences et des éditeurs de logiciels, alors vous n’avez rien à protéger. Vos pages existent pour être lues, comprises et recommandées. Les bloquer, c’est payer un pare-feu pour empêcher les clients d’entrer dans la boutique.

Et non, un blocage ne « protège » pas votre positionnement Google. Ce sont deux sujets distincts, comme je le détaille plus bas pour Google-Extended.

Un blocage de crawler IA n’a de sens que si vous pouvez répondre précisément à la question : qu’est-ce que je vends, exactement, dans cette page ?Romuald Paris

Deux familles de robots que tout le monde confond

C’est l’erreur qui coûte le plus cher, et elle est presque toujours involontaire. On lit « bloquer les IA », on colle une liste de user-agents trouvée sur un forum, et on met dans le même paquet des robots dont le rôle est opposé.

La première famille collecte du texte pour l’entraînement des modèles. Elle passe une fois, aspire, et repart. Ce qu’elle prend ne réapparaîtra dans une réponse que dans une version future du modèle, sans lien cliquable garanti et sans mention de votre nom. GPTBot, ClaudeBot, CCBot ou Applebot-Extended relèvent de cette logique.

La deuxième famille alimente les réponses en direct. Soit elle maintient un index consulté au moment de la question, soit elle va chercher votre page à la seconde où un utilisateur en a besoin. OAI-SearchBot, ChatGPT-User, PerplexityBot, Perplexity-User, Claude-User relèvent de cette logique. Ces robots sont la porte d’entrée de vos citations. C’est exactement le mécanisme que je décris dans mon travail sur la présence dans les réponses de ChatGPT : sans accès, pas de source, donc pas de mention.

Retenez la formule : bloquer l’entraînement, c’est refuser de nourrir la mémoire du modèle. Bloquer la réponse en direct, c’est refuser d’être cité aujourd’hui. La deuxième décision est infiniment plus lourde que la première.

Ce que vous perdez exactement, user-agent par user-agent

Voici l’arbitrage réel. À chaque ligne, la question n’est pas « est-ce que ce robot me prend quelque chose », mais « qu’est-ce qui cesse de fonctionner si je ferme la porte ».

Le cas de Google-Extended mérite d’être isolé, parce que c’est celui qui génère le plus de mauvaises décisions. Google-Extended n’est pas un crawler : c’est un jeton de contrôle d’usage. D’après la documentation de Google, il détermine si votre contenu peut servir à améliorer les modèles Gemini et à alimenter les réponses ancrées de Vertex AI. Google indique qu’il n’a pas d’effet sur l’inclusion ni sur le classement dans Google Search. Autrement dit, le bloquer ne vous protège pas de ce qui s’affiche dans Search, et ne vous fait pas non plus perdre de position. Pour agir sur les extraits affichés dans Search, ce sont les directives de snippet qui s’appliquent, pas Google-Extended.

Notez aussi la logique d’Apple : Applebot alimente Siri et Spotlight, Applebot-Extended concerne l’usage pour l’entraînement. Bloquer le second ne vous sort pas du premier. Cette séparation propre est un bon modèle mental pour lire toutes les autres documentations.

User-agent Rôle déclaré par l’éditeur Ce que vous perdez en le bloquant Ce que vous ne perdez pas
GPTBot Collecte pour l’entraînement des modèles OpenAI Une chance d’être présent dans la connaissance interne d’un futur modèle Vos citations actuelles dans ChatGPT
OAI-SearchBot Index de la recherche de ChatGPT Votre présence dans les résultats et citations de la recherche ChatGPT Rien d’autre, mais c’est déjà beaucoup
ChatGPT-User Lecture d’une page à la demande d’un utilisateur La possibilité pour un prospect de faire lire votre page par ChatGPT Votre référencement Google
ClaudeBot Collecte pour l’entraînement Anthropic Une présence dans les futurs modèles Claude Vos citations en direct dans Claude
Claude-User et Claude-SearchBot Lecture et recherche en direct pour Claude Vos citations dans les réponses de Claude Votre positionnement classique
PerplexityBot Index de Perplexity, source des citations affichées Votre présence comme source citée dans Perplexity Rien qui compense cette perte
Google-Extended Usage du contenu pour Gemini et le grounding Vertex AI Une présence dans les réponses des applications Gemini Votre indexation et votre classement dans Google Search
CCBot Common Crawl, corpus ouvert réutilisé par de nombreux acteurs Votre présence dans un corpus public difficile à tracer Toute visibilité directe identifiable
Applebot-Extended Usage pour l’entraînement d’Apple Intelligence Une présence dans les modèles Apple Applebot, donc Siri et Spotlight, qui restent séparés

Trois robots.txt de référence selon votre profil

Voici les trois configurations que j’utilise en mission. Remplacez l’URL du sitemap par la vôtre, et adaptez les répertoires. Les lignes sont à coller telles quelles, en conservant les majuscules des user-agents et la ligne vide entre chaque bloc.

Profil 1. Prestataire de services, PME, cabinet, artisan, éditeur de logiciel. Votre contenu est un argument commercial. Vous n’avez rien à protéger et tout à gagner à être lisible partout.

User-agent: *
Allow: /
Disallow: /panier/
Disallow: /?s=

Sitemap: https://votresite.fr/sitemap_index.xml

Oui, c’est tout. Le seul travail réel ici n’est pas dans le robots.txt, il est dans la qualité et la structure des pages que ces robots vont lire. C’est le cœur de mon approche du référencement pensé comme un tout.

Profil 2. Éditeur dont le contenu est le produit : média, base documentaire, formation en ligne, contenu vendu à l’abonnement. On refuse l’entraînement, on garde les portes ouvertes pour les citations en direct.

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: *
Allow: /

Sitemap: https://votresite.fr/sitemap_index.xml

Profil 3. Cas mixte : une vitrine ouverte et une zone de contenu à valeur marchande. C’est la configuration la plus fine, et souvent la plus juste. On protège un répertoire précis, on laisse tout le reste accessible.

User-agent: GPTBot
Disallow: /formations/
Disallow: /ressources-premium/
Allow: /

User-agent: ClaudeBot
Disallow: /formations/
Disallow: /ressources-premium/
Allow: /

User-agent: CCBot
Disallow: /formations/
Disallow: /ressources-premium/
Allow: /

User-agent: Google-Extended
Disallow: /formations/
Disallow: /ressources-premium/
Allow: /

User-agent: *
Allow: /

Sitemap: https://votresite.fr/sitemap_index.xml

Dans le profil 3, remarquez que les robots de réponse en direct ne sont jamais nommés. C’est volontaire : ils tombent dans le bloc générique et gardent l’accès complet. Votre contenu premium n’entre pas dans l’entraînement, mais votre offre reste citable.

La procédure de vérification, y compris le piège du plugin et du CDN

Modifier un robots.txt sans le vérifier ensuite, c’est la moitié du travail. Voici la séquence exacte que je déroule après chaque intervention.

Le piège le plus fréquent est le suivant. Sur WordPress, si aucun fichier physique n’existe à la racine, le robots.txt est généré à la volée, souvent par un plugin SEO qui possède sa propre interface d’édition. Dès qu’un fichier physique apparaît, il prend le dessus et l’interface du plugin devient un décor : vous éditez un texte qui ne s’affiche plus. Vérifiez toujours si vous éditez un fichier réel ou un fichier virtuel, et ne gardez qu’une seule source de vérité.

Le deuxième piège se joue au-dessus du site. Certains CDN et pare-feu applicatifs proposent une option de blocage des robots d’IA activable en un clic. Elle agit au niveau réseau, renvoie une erreur avant même que votre robots.txt ne soit lu, et n’apparaît nulle part dans vos fichiers. Résultat : vous pouvez avoir un robots.txt parfaitement ouvert et être totalement inaccessible. J’ai vu ce cas plus souvent que le blocage volontaire.

Dernier point : le robots.txt vaut pour un hôte exact. Un sous-domaine a son propre fichier. Si votre blog est sur une autre adresse que votre site principal, vous avez deux fichiers à gérer, et souvent un seul des deux a été traité.

  • Ouvrez https://votresite.fr/robots.txt en navigation privée. Vérifiez le contenu exact, un code 200 et un type text/plain, pas une page HTML mise en forme.
  • Vérifiez qu’il n’existe pas deux robots.txt en concurrence : un fichier physique déposé à la racine par un ancien prestataire, et un fichier virtuel généré par votre plugin SEO.
  • Simulez un robot avec la ligne de commande : curl -I -A « PerplexityBot » https://votresite.fr/. Un code 403 ou 429 signifie qu’un pare-feu ou un CDN bloque en amont, indépendamment de votre robots.txt.
  • Répétez le test avec GPTBot, OAI-SearchBot, ChatGPT-User et ClaudeBot. Un blocage réseau ne se voit que comme ça.
  • Contrôlez les autres couches de blocage possibles : règles de sécurité du CDN, option anti bots IA activée par défaut, .htaccess, module de protection de l’hébergeur.
  • Testez en conditions réelles : demandez à ChatGPT et à Perplexity de lire une URL précise de votre site et de vous en résumer le contenu. S’ils n’y arrivent pas alors que le robots.txt est ouvert, le blocage est ailleurs.
  • Vérifiez enfin chaque sous-domaine séparément, puis notez la date et la raison de chaque ligne dans un commentaire du fichier, pour que le prochain intervenant ne bloque pas à l’aveugle.

Le contre-exemple : bloquer pour protéger un contenu qui n’a rien à protéger

Le cas typique. Un prestataire de services lit un article sur le pillage des contenus par les IA, s’inquiète, et fait bloquer l’ensemble des user-agents IA connus. Il a le sentiment d’avoir protégé son travail.

Regardons ce qu’il a réellement protégé : une page d’accueil qui présente son métier, une page de tarifs indicatifs, une dizaine de pages de zones d’intervention et quelques articles de conseil. Rien de tout cela n’a de valeur marchande en tant que texte. Personne n’achète ces pages. Elles ne valent que par une seule chose : la mise en relation qu’elles déclenchent.

Et voilà ce qu’il a perdu : le jour où un prospect demande à une IA quel prestataire contacter dans sa ville et son domaine, l’assistant compose sa réponse avec les sources auxquelles il a accès. Le site bloqué n’est pas mal classé, il n’est pas là du tout. C’est exactement le scénario que j’explore dans mon article sur l’entreprise absente quand un client interroge une IA. Une décision prise pour se protéger d’un risque théorique a créé une perte de visibilité bien réelle.

Mon observation de terrain, maintenant, et c’est la partie qui surprend le plus mes clients. La plupart des blocages que je rencontre n’ont jamais été décidés. Ils sont arrivés avec un thème premium, avec la mise à jour d’un plugin qui a proposé une case à cocher bien intentionnée, avec une option de sécurité activée par défaut chez un hébergeur, ou avec un ancien prestataire parti depuis longtemps. Quand je demande qui a pris la décision et pourquoi, personne ne sait. Ce n’est pas une stratégie, c’est un héritage.

Alors avant de vous demander si vous devez bloquer, allez lire votre robots.txt. Il y a une chance réelle que la question soit déjà tranchée dans votre dos.

La plupart des sites que j’audite ne bloquent pas les IA par choix. Ils bloquent par héritage, et personne dans l’entreprise ne sait qui a coché la case.Romuald Paris

À retenir

Séparez toujours les robots d’entraînement (GPTBot, ClaudeBot, CCBot, Applebot-Extended) des robots de réponse en direct (OAI-SearchBot, ChatGPT-User, PerplexityBot, Perplexity-User, Claude-User). Bloquer les premiers coûte peu, bloquer les seconds vous efface des citations.

Si votre contenu est un argument commercial et non le produit vendu, la bonne configuration est un robots.txt ouvert. Vous n’avez rien à protéger et tout à perdre.

Google-Extended concerne l’usage du contenu pour Gemini et le grounding Vertex AI. D’après Google, il n’a pas d’effet sur l’inclusion ni le classement dans Google Search.

Un robots.txt ouvert ne garantit rien : un CDN, un pare-feu ou une option de sécurité de l’hébergeur peuvent bloquer en amont, invisible dans le fichier. Testez avec curl et un user-agent simulé.

Sur WordPress, un fichier physique à la racine écrase le robots.txt virtuel de votre plugin SEO. Vous pouvez éditer un texte qui n’est plus servi.

En résumé

Bloquer les crawlers IA ne se décide pas robot par robot mais famille par famille : l’entraînement des modèles d’un côté, les réponses en direct de l’autre.

Les entreprises dont le contenu sert à vendre autre chose n’ont aucun intérêt à bloquer, et un intérêt majeur à rester lisibles pour les robots qui alimentent les citations.

Trois robots.txt de référence couvrent l’essentiel des situations : ouverture totale, refus de l’entraînement avec citations préservées, et blocage sélectif d’un répertoire premium.

Après toute modification, la vérification passe par le fichier servi, la détection d’un double robots.txt, un test curl par user-agent et un contrôle des règles CDN.

Dans la pratique, la majorité des blocages observés sont hérités d’un thème, d’un plugin ou d’un ancien prestataire, jamais assumés comme une décision.

Questions fréquentes

Bloquer GPTBot fait-il baisser mon référencement sur Google ?

Non. GPTBot est un robot d’OpenAI, il n’a aucun rôle dans l’exploration ni le classement de Google. Le crawler de Google est Googlebot, et le jeton Google-Extended, qui concerne l’usage du contenu pour Gemini et le grounding Vertex AI, n’a selon Google aucun effet sur l’inclusion ou le classement dans Google Search. Bloquer GPTBot n’a donc pas d’impact SEO. En revanche, cela réduit la probabilité que votre contenu soit présent dans la connaissance interne des futurs modèles OpenAI.

Quelle est la différence entre GPTBot, OAI-SearchBot et ChatGPT-User ?

GPTBot collecte du contenu pour l’entraînement des modèles d’OpenAI. OAI-SearchBot alimente l’index utilisé par la recherche de ChatGPT, donc les résultats et les liens affichés. ChatGPT-User récupère une page précise au moment où un utilisateur le demande dans une conversation. Bloquer GPTBot ne vous sort pas des réponses de ChatGPT. Bloquer OAI-SearchBot et ChatGPT-User, si.

Bloquer PerplexityBot protège-t-il mon contenu ?

PerplexityBot alimente l’index qui sert à produire les réponses de Perplexity et les sources citées à côté. Le bloquer ne protège pas un actif, cela supprime la possibilité d’apparaître comme source citée avec un lien vers votre site. Pour une entreprise qui cherche des prospects, c’est le blocage au coût le plus élevé et au bénéfice le plus faible.

Mon robots.txt est ouvert mais les IA ne semblent pas lire mon site, pourquoi ?

Dans la majorité des cas, le blocage est ailleurs. Un pare-feu applicatif, une option anti bots IA activée sur votre CDN, une règle de l’hébergeur ou un .htaccess peuvent renvoyer une erreur avant même que le robots.txt ne soit consulté. Testez avec la commande curl -I -A « PerplexityBot » suivie de l’adresse de votre site : un code 403 ou 429 confirme un blocage en amont. Vérifiez aussi qu’un fichier robots.txt physique déposé à la racine ne remplace pas celui que vous éditez dans votre plugin.

Peut-on bloquer l’entraînement tout en restant cité par les IA ?

Oui, c’est même la configuration la plus rationnelle pour un éditeur dont le contenu est le produit. Vous refusez l’accès aux robots d’entraînement comme GPTBot, ClaudeBot, CCBot, Google-Extended et Applebot-Extended, et vous laissez ouverts les robots de réponse en direct comme OAI-SearchBot, ChatGPT-User, Claude-User, PerplexityBot et Perplexity-User. Votre texte ne nourrit pas les modèles, mais votre marque reste citable au moment où la question est posée.

Faut-il bloquer différemment un site e-commerce ?

Un site e-commerce vend des produits, pas des descriptions. Il gagne à rester accessible aux robots de réponse pour être recommandé, et n’a en général aucun bénéfice à bloquer les robots d’entraînement, sauf si ses fiches produit contiennent une documentation technique exclusive qu’il monétise par ailleurs. Dans ce cas, le blocage sélectif par répertoire est la bonne réponse, pas un blocage à la racine.

Pour aller plus loin : présence dans les réponses de ChatGPT et référencement pensé comme un tout et l’entreprise absente quand un client interroge une IA et mes offres de visibilité SEO et IA.

Vous ne savez pas ce que votre robots.txt bloque aujourd’hui

Je vérifie votre fichier, vos règles CDN et votre accessibilité réelle pour les robots de ChatGPT, Claude, Perplexity et Gemini. Vous repartez avec le fichier exact à mettre en production et la raison de chaque ligne.

Echangeons →

Sources : OpenAI, documentation des robots (GPTBot, OAI-SearchBot, ChatGPT-User) ; Google Search Central, aperçu des crawlers et jetons user-agent dont Google-Extended ; Google Search Central, spécification du fichier robots.txt ; Anthropic, centre d’aide sur ClaudeBot et le blocage du crawler ; Perplexity, documentation technique sur ses robots ; Common Crawl, page CCBot.

À propos de l’auteur

Romuald Paris, consultant SEO et visibilite IA (GEO), dans le Var.