glossary

Qué recopila CCBot para el archivo web abierto de Common Crawl

Taras Shynkarenko
Taras Shynkarenko
Updated: 7 lectura mínima
Qué recopila CCBot para el archivo web abierto de Common CrawlQué recopila CCBot para el archivo web abierto de Common Crawl

TL;DR

7 lectura mínima

Common Crawl opera CCBot para construir un archivo web abierto y gratuito, publicando bajo la cadena exacta de user agent CCBot/2.0, según la propia documentación de Common Crawl. Common Crawl declara que su corpus contiene más de 300 mil millones de páginas recopiladas desde 2007, y el paper de GPT-3 de OpenAI documenta que una versión filtrada de Common Crawl aportó 410 mil millones de tokens, el 60 por ciento de la mezcla de entrenamiento de ese modelo. Un solo bloque User-agent: CCBot en robots.txt elimina un sitio de todo rastreo futuro.

¿Qué es CCBot?

Common Crawl opera CCBot como el rastreador que construye su archivo web abierto y gratuito, un proyecto que Common Crawl indica que funciona de forma continua desde 2007. El bot solicita páginas de la misma forma que cualquier rastreador, y el propio sitio de Common Crawl informa que el corpus resultante ahora contiene más de 300 mil millones de páginas, con 3 a 5 mil millones de páginas nuevas añadidas cada mes, verificado el 9 September 2026. Ese archivo es público, así que cualquiera, incluido un laboratorio de IA competidor, un investigador universitario o RedReplier, puede descargar las mismas páginas que CCBot recopiló.

¿Cuál es la cadena de user agent de CCBot?

CCBot se identifica con la cadena exacta CCBot/2.0 (https://commoncrawl.org/faq/), según la propia documentación de CCBot de Common Crawl, verificada el 9 September 2026. Common Crawl advierte en esa misma página que otros rastreadores se identifican falsamente como CCBot, así que la cadena por sí sola es una afirmación que una solicitud hace sobre sí misma, no una prueba de origen. Compare la dirección IP de origen con el rango publicado por Common Crawl antes de confiar en el encabezado.

DetalleValorFuente
Cadena de user agentCCBot/2.0 (https://commoncrawl.org/faq/)commoncrawl.org/ccbot
Verificación de IPPublicada como JSON en index.commoncrawl.org/ccbot.jsoncommoncrawl.org/ccbot
Token de robots.txtCCBotcommoncrawl.org/ccbot
Tamaño del corpusMás de 300 mil millones de páginas desde 2007commoncrawl.org

Filas de racks de servidores representan el archivo que Common Crawl empaqueta y almacena de cada rastreo mensual.

¿Qué publica Common Crawl?

Common Crawl publica capturas de páginas web en bruto junto con extractos de metadatos y extractos de texto sacados de cada rastreo, y su propio sitio indica que el archivo ha crecido a más de 300 mil millones de páginas desde que el proyecto comenzó en 2007. El mecanismo es un ciclo de rastreo mensual: CCBot solicita un conjunto fresco de URLs, Common Crawl empaqueta los resultados, y el rastreo empaquetado se vuelve descargable por cualquiera sin necesidad de inicio de sesión ni pago. Un sitio que quiera que sus páginas estén disponibles para este tipo de reutilización abierta no necesita ninguna configuración, ya que el estado por defecto es abierto.

¿Cómo afecta bloquear a CCBot a los corpus de entrenamiento de IA construidos a partir de Common Crawl?

Bloquear a CCBot elimina un sitio del archivo que Common Crawl publica, y ese archivo es un insumo documentado para el trabajo de entrenamiento de IA realizado fuera de la propia Common Crawl. El paper de OpenAI sobre GPT-3, Brown et al., 2020, incluye "Common Crawl (filtered)" en su tabla de datos de entrenamiento con 410 mil millones de tokens, el 60 por ciento de la mezcla de entrenamiento de ese modelo, la fuente individual más grande de esa tabla. El mecanismo funciona en una sola dirección: una página que CCBot nunca captura no puede aparecer en una instantánea de Common Crawl, y un conjunto de datos que otro laboratorio filtra de esa instantánea hereda la misma ausencia, así que un sitio decide su exposición a esta vía específica hacia el entrenamiento de IA al decidir si deja entrar a CCBot o no.

RastreadorOperadorCómo alimenta el entrenamiento de IAToken de robots.txt
CCBotCommon CrawlPublica un archivo abierto que laboratorios externos filtran en conjuntos de entrenamientoCCBot
GPTBotOpenAIRastrea directamente para entrenar los propios modelos fundacionales de OpenAIGPTBot

Un desarrollador edita un archivo de texto, el tipo de cambio necesario para añadir una regla de CCBot en robots.txt.

¿Cómo se bloquea a CCBot en robots.txt?

Agregue un bloque de user agent dedicado que nombre a CCBot y bloquee las rutas que quiera excluir de todo rastreo futuro.

User-agent: CCBot
Disallow: /

Ese único bloque, publicado exactamente en esta forma en la propia página de CCBot de Common Crawl, detiene a CCBot de solicitar cualquier página del sitio de ahí en adelante, aunque no elimina páginas que un rastreo anterior ya capturó. Las páginas ya publicadas en una instantánea anterior de Common Crawl permanecen en esa instantánea, así que una nueva regla de robots.txt solo afecta los rastreos a partir de ese momento. La misma sintaxis acepta una ruta más específica, como Disallow: /private/, cuando solo parte de un sitio necesita mantenerse fuera del archivo.

¿Cómo se verifica una solicitud que dice ser CCBot?

Compare la dirección IP de origen de la solicitud con la lista publicada de IPs de CCBot de Common Crawl en index.commoncrawl.org/ccbot.json antes de confiar solo en la cadena de user agent, ya que la propia documentación de Common Crawl señala el tráfico de CCBot falsificado como un problema conocido. Las direcciones IPv4 de CCBot llevan DNS inverso funcional, lo que da una segunda forma de confirmar el origen de una solicitud de forma independiente del encabezado. Un visitante que envía la cadena de user agent de CCBot desde una dirección fuera de ese rango publicado no es CCBot, diga lo que diga el encabezado.

Cómo una regla de robots.txt llega a un conjunto de entrenamiento de IA
CCBot rastrea la web abierta para Common Crawl
Common Crawl publica el resultado como un archivo abierto y gratuito
Laboratorios externos, como OpenAI para GPT-3, filtran ese archivo en datos de entrenamiento
Un bloque User-agent: CCBot elimina a un sitio antes de que nada de eso ocurra
Mecanismo obtenido de la propia página de CCBot de Common Crawl y del paper de GPT-3 de OpenAI (Brown et al., 2020), ambos verificados el 9 September 2026.

¿Debe un sitio permitir o bloquear a CCBot?

Permitir a CCBot significa no agregar ninguna regla disallow para su user agent, lo que mantiene a un sitio dentro de un archivo de investigación ampliamente reutilizado y sin costo que Common Crawl ha publicado mensualmente desde 2007. Bloquearlo significa agregar la regla de dos líneas de arriba, lo que mantiene a un sitio fuera de ese archivo y de cualquier conjunto de datos derivado que otro laboratorio filtre de él, al costo de perder cualquier beneficio de cita o descubrimiento que venga de aparecer en investigación abierta. La elección es la misma que se cubre para Amazonbot y Applebot-Extended: un rastreador con nombre y propósito documentado, controlado por una línea que lo nombra en robots.txt.

Si siquiera está permitido rastrear y reutilizar una página de esta forma es una cuestión legal aparte, cubierta en es legal el web scraping, que se aplica a CCBot igual que se aplica a cualquier bot que extrae contenido de un sitio que no posee. Una vez que el contenido llega a una respuesta de IA por una vía como esta, monitoreo de marca en búsqueda con IA rastrea cómo termina representada una marca en esa respuesta, que es el resultado que importa una vez que el rastreo en sí ya terminó.

Permitir o bloquear a CCBot
Permitir a CCBot
  • Permanece dentro del archivo abierto que Common Crawl opera desde 2007
  • No requiere cambios en robots.txt, ya que el acceso abierto es el estado por defecto
  • Reutilizable por laboratorios de IA externos, universidades y competidores por igual
Bloquear a CCBot
  • Una regla de robots.txt de dos líneas detiene todo rastreo futuro
  • Queda excluido de cualquier conjunto de datos que otro laboratorio filtre del archivo, como la mezcla de entrenamiento de GPT-3
  • Las páginas ya capturadas en una instantánea pasada siguen publicadas de todas formas
Ambos caminos están documentados en la propia página de CCBot de Common Crawl y en el paper de GPT-3 de OpenAI (Brown et al., 2020).

Preguntas frecuentes

¿Bloquear a CCBot elimina mi sitio de archivos pasados de Common Crawl?

No. Una regla de robots.txt solo detiene rastreos futuros; no llega a una instantánea de Common Crawl ya publicada antes de que la regla existiera. Las páginas capturadas en un rastreo anterior permanecen en el archivo de ese rastreo.

¿Cómo sé si una solicitud es realmente CCBot y no un rastreador falsificado?

Compare la dirección IP de origen de la solicitud con la lista publicada de IPs de CCBot de Common Crawl en index.commoncrawl.org/ccbot.json. La propia documentación de Common Crawl indica que otros rastreadores se identifican falsamente como CCBot, así que el encabezado de user agent por sí solo no es prueba.

¿Common Crawl cobra por el acceso a su archivo?

El propio sitio de Common Crawl describe el corpus como gratuito y abierto, sin necesidad de inicio de sesión ni pago para descargar un rastreo. Ese acceso abierto es lo que permite a laboratorios externos construir sus propios conjuntos de datos a partir de él.

¿Puedo bloquear a CCBot solo en parte de mi sitio?

Sí. Una regla disallow bajo el bloque de user agent de CCBot acepta una ruta específica, como Disallow: /private/, así que el resto del sitio permanece abierto para el mismo rastreador.

RedReplier
RedReplier

Comenzar

Reddit, X, Bluesky y HN

Alertas de intención en tiempo real

Respuestas IA ilimitadas

Ordenado por intención de compra

¿Es Common Crawl lo mismo que el rastreador propio de una empresa de IA?

No. Common Crawl publica un archivo abierto que cualquier organización externa puede descargar y filtrar, mientras que un rastreador como GPTBot rastrea directamente para su propio operador, OpenAI, para entrenar los modelos de ese operador.

¿Con qué frecuencia publica Common Crawl un nuevo rastreo?

El propio sitio de Common Crawl indica que añade de 3 a 5 mil millones de páginas nuevas cada mes, como parte de un archivo que funciona desde 2007 y que ahora contiene más de 300 mil millones de páginas. Una regla de robots.txt añadida en cualquier momento se aplica desde ese ciclo de rastreo en adelante.

¿Qué formatos publica Common Crawl de cada rastreo?

Common Crawl publica capturas de páginas web sin procesar junto con extractos de metadatos y extractos de texto de cada rastreo mensual. Cada una de estas descargas es gratuita y sin necesidad de inicio de sesión en cuanto Common Crawl empaqueta los resultados. El archivo construido a partir de estas publicaciones ya contiene más de 300.000 millones de páginas desde 2007.

¿CCBot necesita alguna configuración para empezar a rastrear un sitio nuevo?

CCBot rastrea un sitio por defecto, ya que el estado predeterminado que usa Common Crawl es de acceso abierto sin ninguna configuración. Un propietario de sitio solo necesita actuar para bloquear a CCBot, usando la regla de robots.txt de dos líneas que nombra el user agent de CCBot.

¿Por qué importa el paper de GPT-3 de OpenAI a la hora de decidir si bloquear a CCBot?

El paper de OpenAI sobre GPT-3, Brown et al. 2020, incluye "Common Crawl (filtrado)" como la fuente individual más grande en su tabla de datos de entrenamiento, con 410.000 millones de tokens y el 60 por ciento de la mezcla de entrenamiento del modelo. Ese conjunto filtrado proviene de páginas que CCBot capturó, así que una página que CCBot nunca rastrea no puede terminar contada en una tabla como esa.

¿Qué es la verificación de DNS inverso de CCBot?

Las direcciones IPv4 publicadas de CCBot llevan entradas de DNS inverso que funcionan, según la propia documentación de Common Crawl. Eso le da a un sitio una segunda forma de confirmar el origen de una solicitud, independiente de comparar la IP con la lista publicada de Common Crawl.

Vernos más en Google

Un clic marca RedReplier como fuente preferida y nuestros artículos aparecen más arriba en tus Noticias destacadas, el modo IA y los resúmenes con IA.

Antes de irte...

RedReplier

RedReplier

Detecta a cada comprador que busca lo que vendes

RedReplier vigila Reddit, X, Bluesky y Hacker News en tiempo real, clasifica cada hilo por intención de compra y redacta tu respuesta, para que llegues primero.

Reddit, X, Bluesky y HN

Alertas de intención en tiempo real

Respuestas IA ilimitadas

Ordenado por intención de compra

Artículos relacionados