TL;DR
7 lecture min.Common Crawl exploite CCBot pour construire une archive web ouverte et gratuite, publiée sous la chaîne user agent exacte CCBot/2.0, selon la documentation de Common Crawl elle-même. Common Crawl indique que son corpus contient plus de 300 milliards de pages collectées depuis 2007, et l'article de GPT-3 d'OpenAI documente qu'une version filtrée de Common Crawl a fourni 410 milliards de tokens, soit 60 pour cent du mélange d'entraînement de ce modèle. Un seul bloc User-agent: CCBot dans robots.txt retire un site de toute exploration future.
Qu'est-ce que CCBot ?
Common Crawl exploite CCBot comme le robot qui construit son archive web ouverte et gratuite, un projet que Common Crawl indique fonctionner en continu depuis 2007. Le robot demande des pages comme le fait tout robot d'exploration, et le site de Common Crawl lui-même rapporte que le corpus résultant contient désormais plus de 300 milliards de pages, avec 3 à 5 milliards de nouvelles pages ajoutées chaque mois, vérifié le 9 September 2026. Cette archive est publique, si bien que n'importe qui, y compris un laboratoire d'IA concurrent, un chercheur universitaire ou RedReplier, peut télécharger les mêmes pages que CCBot a collectées.
Quelle est la chaîne user agent de CCBot ?
CCBot s'identifie avec la chaîne exacte CCBot/2.0 (https://commoncrawl.org/faq/), selon la documentation CCBot de Common Crawl elle-même, vérifiée le 9 September 2026. Common Crawl avertit sur cette même page que d'autres robots se font passer pour CCBot, si bien que la chaîne seule n'est qu'une affirmation qu'une requête fait sur elle-même plutôt qu'une preuve d'origine. Comparez l'adresse IP source à la plage publiée par Common Crawl avant de faire confiance à l'en-tête.
| Détail | Valeur | Source |
|---|---|---|
| Chaîne user agent | CCBot/2.0 (https://commoncrawl.org/faq/) | commoncrawl.org/ccbot |
| Vérification IP | Publiée en JSON sur index.commoncrawl.org/ccbot.json | commoncrawl.org/ccbot |
| Token robots.txt | CCBot | commoncrawl.org/ccbot |
| Taille du corpus | Plus de 300 milliards de pages depuis 2007 | commoncrawl.org |

Que publie Common Crawl ?
Common Crawl publie des captures brutes de pages web accompagnées d'extraits de métadonnées et d'extraits de texte tirés de chaque crawl, et son propre site indique que l'archive a atteint plus de 300 milliards de pages depuis le lancement du projet en 2007. Le mécanisme est un cycle de crawl mensuel : CCBot demande un nouvel ensemble d'URL, Common Crawl empaquette les résultats, et le crawl empaqueté devient téléchargeable par tous sans connexion ni frais. Un site qui veut que ses pages soient disponibles pour ce type de réutilisation ouverte n'a besoin d'aucune configuration, car l'état par défaut est ouvert.
Comment le blocage de CCBot affecte-t-il les corpus d'entraînement IA construits à partir de Common Crawl ?
Bloquer CCBot retire un site de l'archive que Common Crawl publie, et cette archive est une source documentée pour des travaux d'entraînement d'IA menés en dehors de Common Crawl elle-même. L'article d'OpenAI sur GPT-3, Brown et al., 2020, mentionne "Common Crawl (filtered)" dans son tableau de données d'entraînement à hauteur de 410 milliards de tokens, soit 60 pour cent du mélange d'entraînement de ce modèle, la plus grande source individuelle de ce tableau. Le mécanisme fonctionne dans un seul sens : une page que CCBot ne capture jamais ne peut pas apparaître dans un instantané de Common Crawl, et un jeu de données qu'un autre laboratoire filtre à partir de cet instantané hérite de la même absence, si bien qu'un site décide de son exposition à cette voie spécifique vers l'entraînement de l'IA en décidant s'il laisse entrer CCBot ou non.
| Robot | Opérateur | Comment il alimente l'entraînement de l'IA | Token robots.txt |
|---|---|---|---|
| CCBot | Common Crawl | Publie une archive ouverte que des laboratoires externes filtrent en données d'entraînement | CCBot |
| GPTBot | OpenAI | Explore directement pour entraîner les propres modèles de fondation d'OpenAI | GPTBot |

Comment bloquer CCBot dans robots.txt ?
Ajoutez un bloc user agent dédié nommant CCBot et bloquez les chemins que vous voulez exclure de tout crawl futur.
User-agent: CCBot
Disallow: /
Ce seul bloc, publié exactement sous cette forme sur la propre page CCBot de Common Crawl, empêche CCBot de demander toute page du site à partir de maintenant, mais ne retire pas les pages qu'un crawl passé a déjà capturées. Les pages déjà publiées dans un instantané antérieur de Common Crawl restent dans cet instantané, si bien qu'une nouvelle règle robots.txt n'affecte que les crawls à partir de ce moment. La même syntaxe accepte un chemin plus restreint, comme Disallow: /private/, lorsque seule une partie d'un site doit rester hors de l'archive.
Comment vérifier une requête qui prétend être CCBot ?
Comparez l'adresse IP source de la requête à la liste d'adresses IP CCBot publiée par Common Crawl sur index.commoncrawl.org/ccbot.json avant de faire confiance à la seule chaîne user agent, car la documentation de Common Crawl elle-même cite le trafic CCBot usurpé comme un problème connu. Les adresses IPv4 de CCBot disposent d'un DNS inversé fonctionnel, ce qui donne un second moyen de confirmer l'origine d'une requête indépendamment de l'en-tête. Un visiteur qui envoie la chaîne user agent de CCBot depuis une adresse hors de cette plage publiée n'est pas CCBot, quoi que dise l'en-tête.
Un site doit-il autoriser ou bloquer CCBot ?
Autoriser CCBot signifie n'ajouter aucune règle disallow pour son user agent, ce qui maintient un site dans une archive de recherche largement réutilisée et gratuite que Common Crawl publie chaque mois depuis 2007. Le bloquer signifie ajouter la règle de deux lignes ci-dessus, ce qui exclut un site de cette archive et de tout jeu de données en aval qu'un autre laboratoire en filtre, au prix de perdre tout bénéfice de citation ou de découverte lié au fait d'apparaître dans une recherche ouverte. Le choix est le même que celui abordé pour Amazonbot et Applebot-Extended : un robot nommé avec un objectif documenté, contrôlé par une ligne qui le nomme dans robots.txt.
Savoir si une page a même le droit d'être explorée et réutilisée de cette façon est une question juridique distincte, traitée dans le web scraping est-il légal, qui s'applique à CCBot de la même façon qu'à tout bot qui extrait du contenu d'un site qu'il ne possède pas. Une fois qu'un contenu atteint une réponse d'IA par une voie comme celle-ci, la surveillance de marque dans la recherche IA suit la façon dont une marque finit par être représentée dans cette réponse, ce qui est le résultat qui compte une fois le crawl lui-même terminé depuis longtemps.
- Reste dans l'archive ouverte que Common Crawl exploite depuis 2007
- Aucune modification du robots.txt nécessaire, l'accès ouvert étant l'état par défaut
- Réutilisable par des labos d'IA externes, des universités et des concurrents
- Une règle robots.txt de deux lignes arrête tout crawl futur
- Exclu de tout jeu de données qu'un autre labo filtre depuis l'archive, comme le mélange d'entraînement de GPT-3
- Les pages déjà capturées dans un instantané passé restent publiées malgré tout
Questions fréquentes
Bloquer CCBot retire-t-il mon site des archives passées de Common Crawl ?
Non. Une règle robots.txt n'arrête que les crawls futurs ; elle n'atteint pas un instantané de Common Crawl déjà publié avant que la règle n'existe. Les pages capturées dans un crawl antérieur restent dans l'archive de ce crawl.
Comment savoir si une requête est vraiment CCBot et non un robot usurpé ?
Comparez l'adresse IP source de la requête à la liste d'adresses IP CCBot publiée par Common Crawl sur index.commoncrawl.org/ccbot.json. La documentation de Common Crawl elle-même indique que d'autres robots se font passer pour CCBot, si bien que l'en-tête user agent seul n'est pas une preuve.
Common Crawl facture-t-il l'accès à son archive ?
Le propre site de Common Crawl décrit le corpus comme gratuit et ouvert, sans connexion ni frais requis pour télécharger un crawl. Cet accès ouvert est ce qui permet à des laboratoires externes de construire leurs propres jeux de données à partir de celui-ci.
Puis-je bloquer CCBot seulement sur une partie de mon site ?
Oui. Une règle disallow sous le bloc user agent de CCBot accepte un chemin spécifique, comme Disallow: /private/, si bien que le reste du site reste ouvert au même robot.
RedReplier
Commencer
Reddit, X, Bluesky et HN
Alertes d'intention en temps réel
Réponses IA illimitées
Classé par intention d'achat
Common Crawl est-il la même chose que le robot propre d'une entreprise d'IA ?
Non. Common Crawl publie une archive ouverte que toute organisation externe peut télécharger et filtrer, tandis qu'un robot comme GPTBot explore directement pour son propre opérateur, OpenAI, afin d'entraîner les propres modèles de cet opérateur.
À quelle fréquence Common Crawl publie-t-il un nouveau crawl ?
Le propre site de Common Crawl indique qu'il ajoute 3 à 5 milliards de nouvelles pages chaque mois, dans le cadre d'une archive qui fonctionne depuis 2007 et qui contient désormais plus de 300 milliards de pages. Une règle robots.txt ajoutée à tout moment s'applique à partir de ce cycle de crawl.
Quels formats Common Crawl publie-t-il à chaque crawl ?
Common Crawl publie des captures brutes de pages web ainsi que des extraits de métadonnées et des extraits de texte issus de chaque crawl mensuel. Chacun de ces téléchargements est gratuit et sans connexion requise, dès que Common Crawl a empaqueté les résultats. L'archive construite à partir de ces publications contient déjà plus de 300 milliards de pages depuis 2007.
CCBot a-t-il besoin d'une configuration pour commencer à crawler un nouveau site ?
CCBot crawle un site par défaut, puisque l'état par défaut utilisé par Common Crawl est un accès ouvert sans aucune configuration. Un propriétaire de site n'a besoin d'agir que pour bloquer CCBot, avec la règle robots.txt de deux lignes qui nomme le user agent CCBot.
Pourquoi le paper GPT-3 d'OpenAI compte-t-il pour décider de bloquer CCBot ?
Le paper d'OpenAI sur GPT-3, Brown et al. 2020, cite "Common Crawl (filtré)" comme la plus grande source unique de son tableau de données d'entraînement, avec 410 milliards de tokens et 60 % du mélange d'entraînement du modèle. Ce jeu de données filtré remonte à des pages que CCBot a capturées, donc une page que CCBot ne crawle jamais ne peut pas se retrouver comptée dans un tableau comme celui-là.
Qu'est-ce que la vérification DNS inversé de CCBot ?
Les adresses IPv4 publiées de CCBot portent des entrées DNS inversé fonctionnelles, selon la documentation propre de Common Crawl. Cela donne à un site une seconde façon de confirmer l'origine d'une requête, indépendamment de la comparaison de l'IP avec la liste publiée par Common Crawl.
Nous voir plus souvent sur Google
Un clic définit RedReplier comme source préférée. Nos articles remontent alors dans vos À la une, en mode IA et dans les aperçus IA.
Avant de partir...
RedReplier
Repérez chaque acheteur qui cherche ce que vous vendez
RedReplier surveille Reddit, X, Bluesky et Hacker News en temps réel, classe chaque sujet selon l'intention d'achat et rédige votre réponse, pour que vous arriviez en premier.
Reddit, X, Bluesky et HN
Alertes d'intention en temps réel
Réponses IA illimitées
Classé par intention d'achat
Articles connexes


Le crawler d'entraînement IA de Meta, meta-externalagent, et comment le bloquer
Meta fait tourner meta-externalagent pour collecter des pages publiques et entraîner ses modèles IA. Voici la chaîne user agent exacte et le blocage robots.txt.


En quoi ChatGPT-User diffère de GPTBot et OAI-SearchBot
L'agent ChatGPT-User d'OpenAI récupère une page seulement si quelqu'un demande à ChatGPT d'ouvrir un lien, différent de la règle pour GPTBot ou OAI-SearchBot.


Comment Cloudflare Pay Per Crawl facture les bots IA par page
Cloudflare Pay Per Crawl renvoie une réponse HTTP 402 tant qu'un robot d'IA ne paie pas le prix exact par requête que le propriétaire du site a lui-même fixé.

