glossary

Ce que CCBot collecte pour l'archive web ouverte de Common Crawl

Taras Shynkarenko
Taras Shynkarenko
Updated: 7 lecture min.
Ce que CCBot collecte pour l'archive web ouverte de Common CrawlCe que CCBot collecte pour l'archive web ouverte de Common Crawl

TL;DR

7 lecture min.

Common Crawl exploite CCBot pour construire une archive web ouverte et gratuite, publiée sous la chaîne user agent exacte CCBot/2.0, selon la documentation de Common Crawl elle-même. Common Crawl indique que son corpus contient plus de 300 milliards de pages collectées depuis 2007, et l'article de GPT-3 d'OpenAI documente qu'une version filtrée de Common Crawl a fourni 410 milliards de tokens, soit 60 pour cent du mélange d'entraînement de ce modèle. Un seul bloc User-agent: CCBot dans robots.txt retire un site de toute exploration future.

Qu'est-ce que CCBot ?

Common Crawl exploite CCBot comme le robot qui construit son archive web ouverte et gratuite, un projet que Common Crawl indique fonctionner en continu depuis 2007. Le robot demande des pages comme le fait tout robot d'exploration, et le site de Common Crawl lui-même rapporte que le corpus résultant contient désormais plus de 300 milliards de pages, avec 3 à 5 milliards de nouvelles pages ajoutées chaque mois, vérifié le 9 September 2026. Cette archive est publique, si bien que n'importe qui, y compris un laboratoire d'IA concurrent, un chercheur universitaire ou RedReplier, peut télécharger les mêmes pages que CCBot a collectées.

Quelle est la chaîne user agent de CCBot ?

CCBot s'identifie avec la chaîne exacte CCBot/2.0 (https://commoncrawl.org/faq/), selon la documentation CCBot de Common Crawl elle-même, vérifiée le 9 September 2026. Common Crawl avertit sur cette même page que d'autres robots se font passer pour CCBot, si bien que la chaîne seule n'est qu'une affirmation qu'une requête fait sur elle-même plutôt qu'une preuve d'origine. Comparez l'adresse IP source à la plage publiée par Common Crawl avant de faire confiance à l'en-tête.

DétailValeurSource
Chaîne user agentCCBot/2.0 (https://commoncrawl.org/faq/)commoncrawl.org/ccbot
Vérification IPPubliée en JSON sur index.commoncrawl.org/ccbot.jsoncommoncrawl.org/ccbot
Token robots.txtCCBotcommoncrawl.org/ccbot
Taille du corpusPlus de 300 milliards de pages depuis 2007commoncrawl.org

Des rangées de baies de serveurs représentent l'archive que Common Crawl assemble et stocke à partir de chaque crawl mensuel.

Que publie Common Crawl ?

Common Crawl publie des captures brutes de pages web accompagnées d'extraits de métadonnées et d'extraits de texte tirés de chaque crawl, et son propre site indique que l'archive a atteint plus de 300 milliards de pages depuis le lancement du projet en 2007. Le mécanisme est un cycle de crawl mensuel : CCBot demande un nouvel ensemble d'URL, Common Crawl empaquette les résultats, et le crawl empaqueté devient téléchargeable par tous sans connexion ni frais. Un site qui veut que ses pages soient disponibles pour ce type de réutilisation ouverte n'a besoin d'aucune configuration, car l'état par défaut est ouvert.

Comment le blocage de CCBot affecte-t-il les corpus d'entraînement IA construits à partir de Common Crawl ?

Bloquer CCBot retire un site de l'archive que Common Crawl publie, et cette archive est une source documentée pour des travaux d'entraînement d'IA menés en dehors de Common Crawl elle-même. L'article d'OpenAI sur GPT-3, Brown et al., 2020, mentionne "Common Crawl (filtered)" dans son tableau de données d'entraînement à hauteur de 410 milliards de tokens, soit 60 pour cent du mélange d'entraînement de ce modèle, la plus grande source individuelle de ce tableau. Le mécanisme fonctionne dans un seul sens : une page que CCBot ne capture jamais ne peut pas apparaître dans un instantané de Common Crawl, et un jeu de données qu'un autre laboratoire filtre à partir de cet instantané hérite de la même absence, si bien qu'un site décide de son exposition à cette voie spécifique vers l'entraînement de l'IA en décidant s'il laisse entrer CCBot ou non.

RobotOpérateurComment il alimente l'entraînement de l'IAToken robots.txt
CCBotCommon CrawlPublie une archive ouverte que des laboratoires externes filtrent en données d'entraînementCCBot
GPTBotOpenAIExplore directement pour entraîner les propres modèles de fondation d'OpenAIGPTBot

Un développeur modifie un fichier texte, le type de changement nécessaire pour ajouter une règle CCBot dans robots.txt.

Comment bloquer CCBot dans robots.txt ?

Ajoutez un bloc user agent dédié nommant CCBot et bloquez les chemins que vous voulez exclure de tout crawl futur.

User-agent: CCBot
Disallow: /

Ce seul bloc, publié exactement sous cette forme sur la propre page CCBot de Common Crawl, empêche CCBot de demander toute page du site à partir de maintenant, mais ne retire pas les pages qu'un crawl passé a déjà capturées. Les pages déjà publiées dans un instantané antérieur de Common Crawl restent dans cet instantané, si bien qu'une nouvelle règle robots.txt n'affecte que les crawls à partir de ce moment. La même syntaxe accepte un chemin plus restreint, comme Disallow: /private/, lorsque seule une partie d'un site doit rester hors de l'archive.

Comment vérifier une requête qui prétend être CCBot ?

Comparez l'adresse IP source de la requête à la liste d'adresses IP CCBot publiée par Common Crawl sur index.commoncrawl.org/ccbot.json avant de faire confiance à la seule chaîne user agent, car la documentation de Common Crawl elle-même cite le trafic CCBot usurpé comme un problème connu. Les adresses IPv4 de CCBot disposent d'un DNS inversé fonctionnel, ce qui donne un second moyen de confirmer l'origine d'une requête indépendamment de l'en-tête. Un visiteur qui envoie la chaîne user agent de CCBot depuis une adresse hors de cette plage publiée n'est pas CCBot, quoi que dise l'en-tête.

Comment une règle robots.txt atteint un jeu d'entraînement IA
CCBot explore le web ouvert pour Common Crawl
Common Crawl publie le résultat comme une archive ouverte et gratuite
Des laboratoires externes, comme OpenAI pour GPT-3, filtrent cette archive en données d'entraînement
Un bloc User-agent: CCBot retire un site avant que rien de tout cela n'arrive
Mécanisme d'après la propre page CCBot de Common Crawl et l'article GPT-3 d'OpenAI (Brown et al., 2020), tous deux vérifiés le 9 September 2026.

Un site doit-il autoriser ou bloquer CCBot ?

Autoriser CCBot signifie n'ajouter aucune règle disallow pour son user agent, ce qui maintient un site dans une archive de recherche largement réutilisée et gratuite que Common Crawl publie chaque mois depuis 2007. Le bloquer signifie ajouter la règle de deux lignes ci-dessus, ce qui exclut un site de cette archive et de tout jeu de données en aval qu'un autre laboratoire en filtre, au prix de perdre tout bénéfice de citation ou de découverte lié au fait d'apparaître dans une recherche ouverte. Le choix est le même que celui abordé pour Amazonbot et Applebot-Extended : un robot nommé avec un objectif documenté, contrôlé par une ligne qui le nomme dans robots.txt.

Savoir si une page a même le droit d'être explorée et réutilisée de cette façon est une question juridique distincte, traitée dans le web scraping est-il légal, qui s'applique à CCBot de la même façon qu'à tout bot qui extrait du contenu d'un site qu'il ne possède pas. Une fois qu'un contenu atteint une réponse d'IA par une voie comme celle-ci, la surveillance de marque dans la recherche IA suit la façon dont une marque finit par être représentée dans cette réponse, ce qui est le résultat qui compte une fois le crawl lui-même terminé depuis longtemps.

Autoriser ou bloquer CCBot
Autoriser CCBot
  • Reste dans l'archive ouverte que Common Crawl exploite depuis 2007
  • Aucune modification du robots.txt nécessaire, l'accès ouvert étant l'état par défaut
  • Réutilisable par des labos d'IA externes, des universités et des concurrents
Bloquer CCBot
  • Une règle robots.txt de deux lignes arrête tout crawl futur
  • Exclu de tout jeu de données qu'un autre labo filtre depuis l'archive, comme le mélange d'entraînement de GPT-3
  • Les pages déjà capturées dans un instantané passé restent publiées malgré tout
Les deux options sont documentées sur la page CCBot de Common Crawl et dans le paper GPT-3 d'OpenAI (Brown et al., 2020).

Questions fréquentes

Bloquer CCBot retire-t-il mon site des archives passées de Common Crawl ?

Non. Une règle robots.txt n'arrête que les crawls futurs ; elle n'atteint pas un instantané de Common Crawl déjà publié avant que la règle n'existe. Les pages capturées dans un crawl antérieur restent dans l'archive de ce crawl.

Comment savoir si une requête est vraiment CCBot et non un robot usurpé ?

Comparez l'adresse IP source de la requête à la liste d'adresses IP CCBot publiée par Common Crawl sur index.commoncrawl.org/ccbot.json. La documentation de Common Crawl elle-même indique que d'autres robots se font passer pour CCBot, si bien que l'en-tête user agent seul n'est pas une preuve.

Common Crawl facture-t-il l'accès à son archive ?

Le propre site de Common Crawl décrit le corpus comme gratuit et ouvert, sans connexion ni frais requis pour télécharger un crawl. Cet accès ouvert est ce qui permet à des laboratoires externes de construire leurs propres jeux de données à partir de celui-ci.

Puis-je bloquer CCBot seulement sur une partie de mon site ?

Oui. Une règle disallow sous le bloc user agent de CCBot accepte un chemin spécifique, comme Disallow: /private/, si bien que le reste du site reste ouvert au même robot.

RedReplier
RedReplier

Commencer

Reddit, X, Bluesky et HN

Alertes d'intention en temps réel

Réponses IA illimitées

Classé par intention d'achat

Common Crawl est-il la même chose que le robot propre d'une entreprise d'IA ?

Non. Common Crawl publie une archive ouverte que toute organisation externe peut télécharger et filtrer, tandis qu'un robot comme GPTBot explore directement pour son propre opérateur, OpenAI, afin d'entraîner les propres modèles de cet opérateur.

À quelle fréquence Common Crawl publie-t-il un nouveau crawl ?

Le propre site de Common Crawl indique qu'il ajoute 3 à 5 milliards de nouvelles pages chaque mois, dans le cadre d'une archive qui fonctionne depuis 2007 et qui contient désormais plus de 300 milliards de pages. Une règle robots.txt ajoutée à tout moment s'applique à partir de ce cycle de crawl.

Quels formats Common Crawl publie-t-il à chaque crawl ?

Common Crawl publie des captures brutes de pages web ainsi que des extraits de métadonnées et des extraits de texte issus de chaque crawl mensuel. Chacun de ces téléchargements est gratuit et sans connexion requise, dès que Common Crawl a empaqueté les résultats. L'archive construite à partir de ces publications contient déjà plus de 300 milliards de pages depuis 2007.

CCBot a-t-il besoin d'une configuration pour commencer à crawler un nouveau site ?

CCBot crawle un site par défaut, puisque l'état par défaut utilisé par Common Crawl est un accès ouvert sans aucune configuration. Un propriétaire de site n'a besoin d'agir que pour bloquer CCBot, avec la règle robots.txt de deux lignes qui nomme le user agent CCBot.

Pourquoi le paper GPT-3 d'OpenAI compte-t-il pour décider de bloquer CCBot ?

Le paper d'OpenAI sur GPT-3, Brown et al. 2020, cite "Common Crawl (filtré)" comme la plus grande source unique de son tableau de données d'entraînement, avec 410 milliards de tokens et 60 % du mélange d'entraînement du modèle. Ce jeu de données filtré remonte à des pages que CCBot a capturées, donc une page que CCBot ne crawle jamais ne peut pas se retrouver comptée dans un tableau comme celui-là.

Qu'est-ce que la vérification DNS inversé de CCBot ?

Les adresses IPv4 publiées de CCBot portent des entrées DNS inversé fonctionnelles, selon la documentation propre de Common Crawl. Cela donne à un site une seconde façon de confirmer l'origine d'une requête, indépendamment de la comparaison de l'IP avec la liste publiée par Common Crawl.

Nous voir plus souvent sur Google

Un clic définit RedReplier comme source préférée. Nos articles remontent alors dans vos À la une, en mode IA et dans les aperçus IA.

Avant de partir...

RedReplier

RedReplier

Repérez chaque acheteur qui cherche ce que vous vendez

RedReplier surveille Reddit, X, Bluesky et Hacker News en temps réel, classe chaque sujet selon l'intention d'achat et rédige votre réponse, pour que vous arriviez en premier.

Reddit, X, Bluesky et HN

Alertes d'intention en temps réel

Réponses IA illimitées

Classé par intention d'achat

Articles connexes