glossary

Bloquer OAI-SearchBot vs GPTBot vous coûte deux choses différentes

Taras Shynkarenko
Taras Shynkarenko
Updated: 9 lecture min.
Bloquer OAI-SearchBot vs GPTBot vous coûte deux choses différentesBloquer OAI-SearchBot vs GPTBot vous coûte deux choses différentes

TL;DR

9 lecture min.

OpenAI documente trois agents web avec trois missions : GPTBot explore pour entraîner les modèles de fondation d'IA générative, OAI-SearchBot explore pour faire remonter les sites dans la fonction de recherche de ChatGPT, et ChatGPT-User récupère la seule page qu'une personne a demandé à ChatGPT d'ouvrir. Interdire GPTBot retire vos pages des données d'entraînement en laissant la recherche ChatGPT intacte, et interdire OAI-SearchBot vous retire de la surface que les gens lisent et cliquent. Les propriétaires de sites qui veulent sortir de l'entraînement tout en gardant le trafic ne doivent nommer que GPTBot.

Quelle est la différence entre OAI-SearchBot vs GPTBot ?

OpenAI fait tourner OAI-SearchBot vs GPTBot comme deux crawlers aux missions sans rapport : OAI-SearchBot récupère des pages pour que la fonction de recherche de ChatGPT puisse les faire remonter, et GPTBot récupère des pages pour entraîner les modèles de fondation d'IA générative d'OpenAI, d'après la documentation bots d'OpenAI sur developers.openai.com, vérifiée le 9 September 2026. Chacun lit son propre bloc nommé dans robots.txt, et une règle écrite pour l'un n'a aucun effet sur l'autre. Cette séparation est tout l'objet de la conception : OpenAI indique qu'il "utilise les balises robots.txt OAI-SearchBot et GPTBot pour permettre aux webmasters de gérer la façon dont leurs sites et leurs contenus interagissent avec l'IA".

Quelles sont les chaînes user agent exactes des crawlers d'OpenAI ?

OpenAI publie la chaîne user agent complète de chaque agent qu'il exploite, et chacune porte une URL descriptive que vous pouvez vérifier. Recopiez-les caractère par caractère quand vous écrivez un filtre de logs, parce qu'une correspondance sur la seule sous-chaîne GPT attrapera trois agents différents d'un coup.

AgentChaîne user agent complètePlages d'IP publiées
GPTBotMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbotopenai.com/gptbot.json
OAI-SearchBotMozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; +https://openai.com/searchbotopenai.com/searchbot.json
ChatGPT-UserMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/botopenai.com/chatgpt-user.json
OAI-AdsBotMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-AdsBot/1.0; +https://openai.com/adsbotopenai.com/adsbot.json

OAI-SearchBot envoie aussi une seconde variante documentée qui insère le token robots.txt avant l'URL : Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; robots.txt; +https://openai.com/searchbot. Écrivez votre filtre de logs contre le token nu OAI-SearchBot pour que les deux variantes tombent dans le même seau.

Un développeur modifie le fichier robots.txt d'un site, en lien avec le choix du crawler OpenAI à bloquer.

Quel bot d'OpenAI faut-il vraiment bloquer ?

Bloquez celui dont vous ne voulez pas le résultat, et la colonne du coût ci-dessous est la partie que les propriétaires de sites sautent. OpenAI rattache chaque agent à une surface produit différente, donc les trois règles achètent trois résultats différents.

AgentCe à quoi OpenAI l'utiliseCe que le bloquer vous coûteDirective robots.txt
GPTBotExplore le contenu pour entraîner les modèles de fondation d'IA générativeVos pages cessent d'alimenter l'entraînement des futurs modèles via cette exploration. La recherche ChatGPT n'est pas touchée.User-agent: GPTBot puis Disallow: /
OAI-SearchBotAlimente les fonctions de recherche de ChatGPT pour faire remonter les sites dans les résultatsOpenAI indique que les sites qui se retirent "ne seront pas affichés dans les réponses de recherche ChatGPT, mais peuvent encore apparaître comme liens de navigation".User-agent: OAI-SearchBot puis Disallow: /
ChatGPT-UserTraite les actions lancées par l'utilisateur dans ChatGPT et les GPT personnalisésChatGPT ne peut pas ouvrir votre page quand une personne colle le lien et pose une question dessus. OpenAI note que les règles robots.txt peuvent ne pas s'appliquer ici, parce que la requête suit une action utilisateur en direct.User-agent: ChatGPT-User puis Disallow: /

Le comportement complet de ce troisième agent, y compris pourquoi une règle robots.txt se comporte autrement pour une récupération déclenchée par l'utilisateur, est traité sur la page dédiée à ChatGPT-User.

Pourquoi la plupart des propriétaires de sites bloquent-ils le mauvais ?

L'erreur consiste à traiter "bloquer les crawlers IA" comme une seule décision alors qu'OpenAI en a construit deux. GPTBot est le nom que les gens reconnaissent de la couverture médiatique sur les données d'entraînement IA, donc il part dans une règle générale à côté d'OAI-SearchBot, et cette règle générale retire le site de la surface qui envoie de vrais lecteurs. Le trafic venu de la fonction de recherche de ChatGPT dépend de l'autorisation donnée à OAI-SearchBot de lire la page qu'il cite ; les données d'entraînement n'envoient absolument personne sur votre site. Tranchez les deux questions séparément, puis écrivez deux blocs.

Quel robots.txt copier selon votre intention ?

Choisissez l'intention qui correspond à votre activité et collez le bloc correspondant à la racine de votre domaine. Chaque groupe User-agent tient seul, donc une directive posée sous un nom n'atteint jamais un autre.

Rester hors de l'entraînement des modèles, garder le trafic de la recherche ChatGPT. C'est le réglage que veulent la plupart des éditeurs et des sites SaaS :

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

Quitter OpenAI entièrement, y compris la surface de recherche et les récupérations demandées par un utilisateur :

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

Tout autoriser sauf les chemins qui ne devraient jamais atteindre un modèle ni une réponse :

User-agent: GPTBot
Disallow: /members/
Disallow: /checkout/
Disallow: /account/

User-agent: OAI-SearchBot
Disallow: /members/
Disallow: /checkout/
Disallow: /account/

Les règles de précédence qui décident quelle ligne l'emporte quand Allow et Disallow correspondent tous deux à une URL vivent dans la référence complète robots.txt.

robots.txt est-il imposé, ou seulement respecté ?

Robots.txt est respecté par convention et imposé par rien. La RFC 9309, le standard Robots Exclusion Protocol publié en septembre 2022, énonce clairement dans ses Security Considerations que "le Robots Exclusion Protocol ne remplace pas des mesures valides de sécurité du contenu", et sa section d'ouverture note que ces règles "ne sont pas une forme d'autorisation d'accès". Une ligne Disallow est une demande qu'un crawler bien élevé lit avant de récupérer, et qu'un crawler mal élevé peut ignorer sans la moindre conséquence technique. Si une page ne doit être lue par personne en dehors de votre mur de connexion, placez-la derrière une authentification ou une règle d'IP côté serveur, et traitez l'entrée robots.txt comme la documentation d'une intention pour les crawlers qui, eux, respectent la règle.

Des rangées de baies de serveurs dans un data center, illustrant l'infrastructure qui journalise et vérifie les adresses IP des crawlers.

Comment vérifier qu'une requête vient bien d'OpenAI ?

Comparez l'adresse IP source aux fichiers JSON qu'OpenAI publie, parce qu'une chaîne user agent est un en-tête que n'importe quel client peut taper. OpenAI liste les plages actuelles sur openai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json et openai.com/adsbot.json, chaque fichier portant un champ creationTime et un tableau de préfixes CIDR. Vérifié le 9 September 2026, openai.com/searchbot.json listait 35 préfixes IPv4 avec un creationTime de 2026-01-02, et openai.com/gptbot.json listait 21 préfixes avec un creationTime de 2025-10-30. Récupérez le fichier régulièrement au lieu de coder les plages en dur, et traitez toute requête portant un token OpenAI depuis une adresse hors de la liste actuelle comme une usurpation, pas comme un crawler qui ignore vos règles.

RedReplier
RedReplier

Commencer

Reddit, X, Bluesky et HN

Alertes d'intention en temps réel

Réponses IA illimitées

Classé par intention d'achat

Combien de temps un changement de robots.txt met-il à atteindre OpenAI ?

La documentation d'OpenAI indique que pour les résultats de recherche "il peut s'écouler environ 24 heures entre la mise à jour du robots.txt d'un site et l'ajustement de nos systèmes". Ce délai s'applique à la surface de recherche, donc un site qui fait passer OAI-SearchBot d'interdit à autorisé doit compter à peu près une journée avant que le comportement de la recherche ChatGPT le reflète. Déployez le changement, notez l'horodatage, et retenez-vous d'une seconde modification tant qu'une journée entière n'est pas passée, parce que deux changements dans la fenêtre de propagation rendent le résultat illisible.

Bloquer le bon agent, puis vérifier que ça tient
1
Choisir la cible. GPTBot alimente l'entraînement des modèles, OAI-SearchBot alimente la recherche ChatGPT. Choisissez l'un, les deux, ou aucun.
2
Écrire un bloc distinct pour chaque agent. Une règle sous un nom de user agent n'atteint jamais un autre.
3
Attendre environ 24 heures. La documentation d'OpenAI indique qu'il faut environ un jour pour qu'un changement de robots.txt se reflète dans la recherche.
4
Vérifier l'IP source, pas seulement le user agent. Comparez les requêtes aux plages CIDR publiées par OpenAI avant de faire confiance à une ligne de journal.
Chaque étape referme la faille laissée par la précédente, du choix de l'agent jusqu'à la confirmation que le blocage tient vraiment.

Que faut-il suivre une fois les règles posées ?

Suivez si ChatGPT vous cite vraiment, parce qu'un robots.txt correct est une entrée et qu'une citation est le résultat. La surveillance de marque dans la recherche IA observe où ChatGPT, Claude et Gemini mentionnent une marque dans leurs réponses, ce qui est la seule lecture directe de ce qu'autoriser OAI-SearchBot vous a rapporté. Le même partage entre entraînement et recherche apparaît chez d'autres fournisseurs : Applebot-Extended est le refus d'entraînement d'Apple qui laisse Siri, Spotlight et la recherche Safari tranquilles, et CCBot est l'archive ouverte de Common Crawl que des labos extérieurs filtrent pour en faire des jeux d'entraînement. Être cité tout court est une discipline distincte d'être exploré, ce que couvre l'answer engine optimization.

Questions fréquentes

Bloquer GPTBot me retire-t-il de la recherche ChatGPT ?

Non. OpenAI documente GPTBot comme le crawler d'entraînement des modèles de fondation d'IA générative et OAI-SearchBot comme le crawler qui alimente les fonctions de recherche de ChatGPT. Un Disallow sous User-agent: GPTBot laisse OAI-SearchBot libre d'explorer, donc la recherche ChatGPT peut toujours faire remonter et citer vos pages.

Que se passe-t-il si je bloque OAI-SearchBot ?

OpenAI indique que les sites retirés d'OAI-SearchBot "ne seront pas affichés dans les réponses de recherche ChatGPT, mais peuvent encore apparaître comme liens de navigation". Vous perdez la citation et le clic qui va avec. OpenAI recommande d'autoriser OAI-SearchBot dans robots.txt pour aider un site à apparaître dans les résultats de recherche.

Existe-t-il une directive unique qui bloque tous les bots d'OpenAI d'un coup ?

Aucun token unique ne les couvre. OpenAI documente GPTBot, OAI-SearchBot, ChatGPT-User et OAI-AdsBot comme des tokens user-agent robots.txt distincts, et chacun a besoin de son propre groupe nommé. Un groupe générique User-agent: * s'applique aux crawlers conformes qui ne trouvent aucun groupe les nommant précisément, donc un agent qui a son propre bloc lit ce bloc à la place.

Quel agent d'OpenAI n'est pas un crawler ?

ChatGPT-User. OpenAI le documente comme traitant les actions lancées par l'utilisateur dans ChatGPT et les GPT personnalisés, c'est-à-dire qu'il récupère une page parce qu'une personne a demandé à ChatGPT d'ouvrir ce lien. OpenAI note que les règles robots.txt peuvent ne pas s'y appliquer de la même façon, puisque la requête dépend d'une action utilisateur en direct.

Que fait OAI-AdsBot ?

OpenAI documente OAI-AdsBot comme l'agent qui valide la sûreté des pages web soumises comme publicités ChatGPT, et indique que "les données collectées par OAI-AdsBot ne servent pas à entraîner les modèles de fondation d'IA générative". Il a son propre token robots.txt et sa propre liste d'IP publiée sur openai.com/adsbot.json. Il est distinct de l'exploration d'entraînement comme de l'exploration de recherche.

Un crawler peut-il ignorer mon fichier robots.txt ?

Oui. La RFC 9309 décrit le Robots Exclusion Protocol comme un ensemble de règles que les crawlers lisent, et sa section Security Considerations indique que le protocole "ne remplace pas des mesures valides de sécurité du contenu". Rien dans le protocole ne bloque une requête au niveau réseau, donc tout ce qui doit rester privé a besoin d'une authentification ou d'un blocage côté serveur à la place.

Faut-il coder en dur les plages d'IP publiées par OpenAI plutôt que de les récupérer à nouveau ?

Les fichiers de plages d'IP d'OpenAI contiennent un champ creationTime qui change à chaque mise à jour de la plage, donc une copie codée en dur devient obsolète dès qu'OpenAI fait tourner son infrastructure. Récupérez plutôt openai.com/gptbot.json, searchbot.json, chatgpt-user.json ou adsbot.json selon un calendrier régulier, et traitez toute requête portant un user agent OpenAI depuis une adresse hors de la liste actuelle comme une usurpation, pas comme un crawler qui ignore robots.txt.

Pourquoi ne pas enchaîner un second changement de robots.txt juste après le premier ?

La documentation d'OpenAI fixe le délai de propagation pour la recherche à environ 24 heures après une mise à jour de robots.txt. Un second changement dans cette fenêtre arrive avant que le premier ait fini de produire son effet, si bien que le résultat observé ensuite ne peut être attribué avec certitude à aucun des deux. Faites un seul changement, notez l'horodatage, et attendez la journée complète avant de retoucher le fichier.

Robots.txt me donne-t-il une quelconque autorité légale sur les crawlers ?

Le RFC 9309 indique dans sa section d'introduction que les règles de robots.txt "ne constituent pas une forme d'autorisation d'accès". Une ligne Disallow demande à un crawler respectueux des règles de sauter une page, mais ne dispose d'aucun mécanisme contre celui qui ne les respecte pas. Le contenu qui a vraiment besoin d'être protégé doit se trouver derrière une authentification ou une règle IP côté serveur, l'entrée robots.txt ne servant alors qu'à documenter une intention.

Les règles GPTBot et OAI-SearchBot peuvent-elles cohabiter dans le même fichier robots.txt ?

Elles le peuvent, et cette combinaison, Disallow pour GPTBot et Allow pour OAI-SearchBot, est exactement ce que la séparation d'OpenAI rend possible pour les sites qui veulent sortir de l'entraînement tout en gardant le trafic de la recherche ChatGPT. Chaque groupe User-agent est lu séparément, donc le bloc GPTBot et le bloc OAI-SearchBot ne se gênent jamais dans le même fichier.

Nous voir plus souvent sur Google

Un clic définit RedReplier comme source préférée. Nos articles remontent alors dans vos À la une, en mode IA et dans les aperçus IA.

Avant de partir...

RedReplier

RedReplier

Repérez chaque acheteur qui cherche ce que vous vendez

RedReplier surveille Reddit, X, Bluesky et Hacker News en temps réel, classe chaque sujet selon l'intention d'achat et rédige votre réponse, pour que vous arriviez en premier.

Reddit, X, Bluesky et HN

Alertes d'intention en temps réel

Réponses IA illimitées

Classé par intention d'achat

Articles connexes