Faut-il bloquer les robots des IA ? Ce que montrent nos relevés

29 septembre 20266 min de lecturePar Olivier Bazière
Sommaire

La question revient souvent en audit : faut-il bloquer les robots des IA ? Elle arrive en général avec une crainte, voir son contenu aspiré sans contrepartie, et une idée reçue : tous ces robots se vaudraient.

Nous mesurons chaque passage de robot IA sur notre propre site depuis le 28 juillet 2026. Jusqu'au 25 septembre, nous en avons compté 9 464. Croisés avec la documentation de chaque opérateur, ces relevés donnent une réponse plus fine qu'un oui ou un non : tout dépend du robot, et tous ne sont pas ceux qu'ils prétendent être.

Tous les robots ne font pas le même travail

Les opérateurs décrivent eux-mêmes des usages différents, et c'est la distinction qui compte :

  • L'entraînement des modèles. GPTBot, ClaudeBot, CCBot ou meta-externalagent collectent des pages qui pourront servir à entraîner des modèles. Les bloquer revient à refuser cet usage pour vos contenus à venir.
  • L'index de recherche. OAI-SearchBot pour ChatGPT, Claude-SearchBot ou PerplexityBot constituent l'index où l'assistant choisit ses sources.
  • La lecture à la demande. ChatGPT-User, Claude-User, Perplexity-User ou DuckAssistBot lisent une page parce qu'un utilisateur vient de poser une question. OpenAI et Perplexity préviennent que les règles du robots.txt peuvent ne pas s'appliquer à ces visites ; Anthropic dit que les siennes les respectent.
  • Les imitateurs. N'importe quel programme peut se présenter sous le nom d'un robot connu. Nous y revenons plus bas, chiffres à l'appui.

Ce que nos relevés montrent

Les robots qui passent le plus sur notre site sont d'abord des collecteurs : meta-externalagent (2 602 passages), Bytespider (2 496), ClaudeBot (770) et CCBot (655). La plupart visent nos anciennes adresses, celles du site d'avant la refonte, qu'ils rejouent depuis leurs archives. ByteDance présente Bytespider comme le robot de son moteur Toutiao et ne dit rien d'un usage pour l'IA : nous ne lui en prêtons donc pas.

Les chiffres qui comptent pour une entreprise sont ailleurs. Sur nos vraies pages, 1 017 lectures ont été déclenchées par une question d'utilisateur : 663 par ChatGPT-User, 351 par Claude-User. Chacune est la trace d'une question posée à un assistant, venu lire l'une de nos pages pour y répondre. OAI-SearchBot, qui alimente l'index de la recherche ChatGPT, est passé 482 fois sur ces mêmes pages.

La tendance compte autant que le total. Ces lectures à la demande sont passées de 50 à 120 par semaine en août à 150 à 185 par semaine en septembre. La collecte, elle, a nettement ralenti : 2 488 passages la semaine du 27 juillet, entre 440 et 750 par semaine depuis fin août.

Côté pages, notre accueil arrive très loin devant : 404 lectures à la demande en 60 jours, dont 337 par ChatGPT. Viennent ensuite nos mentions légales, puis nos pages de service. Un assistant qui lit les mentions légales d'une entreprise cherche vraisemblablement à vérifier qui elle est : raison de plus pour qu'elles soient exactes.

562 requêtes de scanners déguisés en robots IA

Nos relevés comptaient 20 passages de « Google-Extended » et 146 d'« Applebot-Extended ». Aucun des 2 n'est un robot. Google précise que Google-Extended est un simple jeton du robots.txt, sans identifiant propre : l'exploration passe par ses robots habituels. Apple écrit la même chose d'Applebot-Extended, qui n'explore aucune page.

Ces visites venaient donc de programmes qui empruntaient un nom rassurant. En regardant les adresses visées, le phénomène est plus large : 562 requêtes portant un nom de robot IA cherchaient des fichiers qui, sur un site mal configuré, contiennent des secrets, comme /api/.env, /.mcp.json ou /api-keys.json, ou des points d'entrée comme /mcp. Elles arrivaient par rafales de quelques secondes, en changeant de nom à chaque requête. Le nom Claude-User a servi à lui seul 263 fois.

Sur notre site, toutes ces adresses répondent 404 : il n'y a rien à trouver. Pour une TPE, la leçon est double. Vérifiez qu'aucun fichier de configuration n'est accessible depuis l'extérieur, et ne tenez jamais un nom de robot pour une preuve : seule l'adresse d'origine, vérifiée par exemple par une résolution DNS inverse, dit qui frappe vraiment.

Nous avons corrigé notre propre mesure : les faux Google-Extended et Applebot-Extended sont comptés à part, et les requêtes vers ce type d'adresses sont désormais marquées comme des sondes. Les chiffres de cet article ne comptent que les vraies pages du site.

Ce que coûte chaque blocage, selon les opérateurs

  • GPTBot : aucun effet sur la recherche ChatGPT. OpenAI donne l'exemple d'un site qui interdit GPTBot tout en autorisant OAI-SearchBot pour rester visible.
  • OAI-SearchBot : le site n'apparaît plus dans les réponses de la recherche ChatGPT, sinon comme simple lien de navigation, selon OpenAI.
  • Claude-SearchBot et Claude-User : Anthropic prévient que les bloquer peut réduire la visibilité du site dans les réponses de Claude.
  • PerplexityBot : Perplexity recommande de l'autoriser pour apparaître dans ses résultats.
  • Google-Extended : aucun effet sur la recherche Google, ni sur les aperçus IA et le Mode IA, qui dépendent de Googlebot. Le jeton règle l'entraînement de Gemini et l'ancrage de ses réponses.
  • Applebot-Extended : aucun effet sur les résultats de recherche d'Apple ; il ne règle que l'entraînement de ses modèles.
  • CCBot : vos pages à venir sortent de l'archive de Common Crawl, que des tiers utilisent pour entraîner leurs modèles.
  • DuckAssistBot : le site ne peut plus servir de source aux réponses assistées de DuckDuckGo, sans effet sur son classement.

Ce que nous recommandons à une TPE

Pour une entreprise qui veut être trouvée, la règle est simple : laisser passer les robots de recherche et de lecture à la demande. Les bloquer, c'est disparaître des réponses au moment précis où un client pose sa question.

Les robots d'entraînement relèvent d'un choix de principe. OpenAI, Google et Apple disent que les bloquer ne change rien à leurs réponses de recherche ; Anthropic ne se prononce pas sur ce point.

Sur notre site, tout est ouvert, entraînement compris : pour une agence dont le métier est d'être lue, c'est cohérent. Une entreprise qui ne veut pas voir ses textes servir à l'entraînement peut bloquer GPTBot, ClaudeBot, CCBot, Google-Extended et Applebot-Extended, en laissant ouverts OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User et PerplexityBot.

Dans le fichier robots.txt, un blocage tient en 2 lignes par robot : User-agent: GPTBot, puis Disallow: /. Vérifiez ensuite que votre site reste lisible par tous les autres : c'est la base de notre travail de visibilité IA, et le premier point de notre audit GEO gratuit.

Et le fichier llms.txt ?

C'est une proposition publiée en 2024, qui n'a pas le statut de norme : aucun projet n'existe à l'IETF, et aucun grand opérateur ne s'engage, sur une page officielle, à lire ceux des sites. Google écrit même que sa recherche ne l'utilise pas, y compris pour ses fonctions génératives.

Nous en publions un, et nous mesurons depuis le 25 septembre les robots qui le lisent. Notre verdict viendra des chiffres, dans quelques semaines.

FAQ

  • Bloquer GPTBot me retire-t-il de ChatGPT ?

    Non, selon OpenAI. GPTBot collecte pour l'entraînement ; c'est OAI-SearchBot qui alimente la recherche de ChatGPT. Les 2 se règlent séparément dans le robots.txt.

  • Le robots.txt suffit-il à bloquer un robot ?

    Pour les robots qui le respectent. OpenAI et Perplexity préviennent que leurs visites déclenchées par un utilisateur peuvent ne pas l'appliquer, et un imitateur l'ignore par définition.

  • Comment savoir si un robot est bien celui qu'il prétend être ?

    En vérifiant l'adresse d'où vient la visite, par exemple par une vérification DNS inverse. Le nom annoncé ne prouve rien : nous avons relevé 562 requêtes de scanners sous des noms de robots IA.

  • Des robots IA cherchent-ils des failles sur mon site ?

    Des scanners empruntent leurs noms pour le faire. Sur notre site, 562 requêtes visaient des fichiers de secrets en se faisant passer pour ChatGPT, Claude ou Perplexity. Vérifiez qu'aucun fichier de configuration n'est accessible, et que ces adresses répondent 404.

  • Faut-il créer un fichier llms.txt ?

    Rien ne l'impose, et Google dit ne pas s'en servir. C'est une proposition, sans engagement de lecture des grands opérateurs. Il ne coûte presque rien à publier ; nous mesurons s'il est lu avant de le recommander.

Votre visibilité locale mérite une stratégie unifiée.

SEO, GEO, fiche Google, réseaux sociaux : un seul interlocuteur, un seul plan, des résultats concrets.

Moins de prestataires à gérer.Plus de clients qui vous trouvent.

Futur Digital réunit votre site, votre référencement, votre fiche Google et vos réseaux au même endroit, pour que plus rien ne vous échappe, et que vous puissiez vous concentrer sur votre métier.

Sans engagementRapport livré sous 48 h