TL;DR
7 minutos de leituraA Common Crawl opera o CCBot para montar um arquivo web aberto e gratuito, publicando sob a string exata de user agent CCBot/2.0, segundo a própria documentação da Common Crawl. A Common Crawl afirma que seu corpus contém mais de 300 bilhões de páginas coletadas desde 2007, e o artigo do GPT-3 da OpenAI documenta que uma versão filtrada da Common Crawl forneceu 410 bilhões de tokens, 60 por cento da mistura de treinamento desse modelo. Um único bloco User-agent: CCBot no robots.txt remove um site de todo rastreamento futuro.
O que é o CCBot?
A Common Crawl opera o CCBot como o rastreador que monta seu arquivo web aberto e gratuito, um projeto que a Common Crawl afirma rodar continuamente desde 2007. O bot solicita páginas do mesmo jeito que qualquer rastreador, e o próprio site da Common Crawl informa que o corpus resultante hoje tem mais de 300 bilhões de páginas, com 3 a 5 bilhões de páginas novas adicionadas por mês, verificado em 9 September 2026. Esse arquivo é público, então qualquer pessoa, incluindo um laboratório de IA concorrente, um pesquisador universitário ou a RedReplier, pode baixar as mesmas páginas que o CCBot coletou.
Qual é a string de user agent do CCBot?
O CCBot se identifica com a string exata CCBot/2.0 (https://commoncrawl.org/faq/), segundo a própria documentação do CCBot da Common Crawl, verificada em 9 September 2026. A Common Crawl avisa nessa mesma página que outros rastreadores se identificam falsamente como CCBot, então a string sozinha é uma alegação que uma requisição faz sobre si mesma, não uma prova de origem. Compare o endereço IP de origem com o intervalo publicado pela Common Crawl antes de confiar no cabeçalho.
| Detalhe | Valor | Fonte |
|---|---|---|
| String de user agent | CCBot/2.0 (https://commoncrawl.org/faq/) | commoncrawl.org/ccbot |
| Verificação de IP | Publicada como JSON em index.commoncrawl.org/ccbot.json | commoncrawl.org/ccbot |
| Token do robots.txt | CCBot | commoncrawl.org/ccbot |
| Tamanho do corpus | Mais de 300 bilhões de páginas desde 2007 | commoncrawl.org |

O que a Common Crawl publica?
A Common Crawl publica capturas brutas de páginas web junto com extratos de metadados e extratos de texto tirados de cada rastreamento, e o próprio site afirma que o arquivo cresceu para mais de 300 bilhões de páginas desde que o projeto começou em 2007. O mecanismo é um ciclo de rastreamento mensal: o CCBot solicita um conjunto novo de URLs, a Common Crawl empacota os resultados, e o rastreamento empacotado se torna disponível para download por qualquer pessoa, sem login nem taxa. Um site que quer que suas páginas fiquem disponíveis para esse tipo de reuso aberto não precisa de nenhuma configuração, já que o estado padrão é aberto.
Como bloquear o CCBot afeta os corpora de treinamento de IA construídos a partir da Common Crawl?
Bloquear o CCBot remove um site do arquivo que a Common Crawl publica, e esse arquivo é um insumo documentado para trabalho de treinamento de IA feito fora da própria Common Crawl. O artigo da OpenAI sobre o GPT-3, Brown et al., 2020, lista "Common Crawl (filtered)" em sua tabela de dados de treinamento com 410 bilhões de tokens, 60 por cento da mistura de treinamento desse modelo, a maior fonte individual dessa tabela. O mecanismo funciona em uma única direção: uma página que o CCBot nunca captura não pode aparecer em um snapshot da Common Crawl, e um conjunto de dados que outro laboratório filtra desse snapshot herda a mesma ausência, então um site decide sua exposição a essa via específica para o treinamento de IA ao decidir se deixa o CCBot entrar ou não.
| Rastreador | Operador | Como alimenta o treinamento de IA | Token do robots.txt |
|---|---|---|---|
| CCBot | Common Crawl | Publica um arquivo aberto que laboratórios externos filtram em conjuntos de treinamento | CCBot |
| GPTBot | OpenAI | Rastreia diretamente para treinar os próprios modelos de fundação da OpenAI | GPTBot |

Como bloquear o CCBot no robots.txt?
Adicione um bloco de user agent dedicado nomeando o CCBot e bloqueie os caminhos que você quer excluir de todo rastreamento futuro.
User-agent: CCBot
Disallow: /
Esse único bloco, publicado exatamente nessa forma na própria página do CCBot da Common Crawl, impede que o CCBot solicite qualquer página do site daqui em diante, embora não remova páginas que um rastreamento anterior já capturou. Páginas já publicadas em um snapshot anterior da Common Crawl permanecem nesse snapshot, então uma nova regra de robots.txt só afeta rastreamentos a partir daquele ponto. A mesma sintaxe aceita um caminho mais restrito, como Disallow: /private/, quando só parte de um site precisa ficar fora do arquivo.
Como verificar uma requisição que alega ser o CCBot?
Compare o endereço IP de origem da requisição com a lista publicada de IPs do CCBot da Common Crawl em index.commoncrawl.org/ccbot.json antes de confiar apenas na string de user agent, já que a própria documentação da Common Crawl cita o tráfego falsificado de CCBot como um problema conhecido. Os endereços IPv4 do CCBot têm DNS reverso funcional, o que dá uma segunda forma de confirmar a origem de uma requisição independente do cabeçalho. Um visitante que envia a string de user agent do CCBot a partir de um endereço fora desse intervalo publicado não é o CCBot, não importa o que o cabeçalho diga.
Um site deve permitir ou bloquear o CCBot?
Permitir o CCBot significa não adicionar nenhuma regra disallow para seu user agent, o que mantém um site dentro de um arquivo de pesquisa amplamente reutilizado e sem custo que a Common Crawl publica mensalmente desde 2007. Bloqueá-lo significa adicionar a regra de duas linhas acima, o que mantém um site fora desse arquivo e de qualquer conjunto de dados posterior que outro laboratório filtre dele, ao custo de perder qualquer benefício de citação ou descoberta que venha de aparecer em pesquisa aberta. A escolha é a mesma abordada para Amazonbot e Applebot-Extended: um rastreador nomeado com propósito documentado, controlado por uma linha que o nomeia no robots.txt.
Se uma página sequer tem permissão para ser rastreada e reaproveitada dessa forma é uma questão legal separada, coberta em o web scraping é legal, que se aplica ao CCBot do mesmo jeito que se aplica a qualquer bot que extrai conteúdo de um site que não possui. Assim que o conteúdo chega a uma resposta de IA por uma via como essa, o monitoramento de marca na busca com IA acompanha como uma marca acaba representada nessa resposta, que é o resultado que importa depois que o rastreamento em si já terminou há muito.
- Permanece dentro do arquivo aberto que a Common Crawl opera desde 2007
- Não exige mudança no robots.txt, já que o acesso aberto é o estado padrão
- Reutilizável por laboratórios de IA externos, universidades e concorrentes
- Uma regra de robots.txt de duas linhas interrompe todo rastreamento futuro
- Excluído de qualquer conjunto de dados que outro laboratório filtre a partir do arquivo, como a mistura de treinamento do GPT-3
- Páginas já capturadas em um snapshot anterior permanecem publicadas de qualquer forma
Perguntas frequentes
Bloquear o CCBot remove meu site dos arquivos anteriores da Common Crawl?
Não. Uma regra de robots.txt só interrompe rastreamentos futuros; ela não alcança um snapshot da Common Crawl já publicado antes de a regra existir. Páginas capturadas em um rastreamento anterior permanecem no arquivo desse rastreamento.
Como sei se uma requisição é realmente o CCBot e não um rastreador falsificado?
Compare o endereço IP de origem da requisição com a lista publicada de IPs do CCBot da Common Crawl em index.commoncrawl.org/ccbot.json. A própria documentação da Common Crawl afirma que outros rastreadores se identificam falsamente como CCBot, então o cabeçalho de user agent sozinho não é prova.
A Common Crawl cobra pelo acesso ao seu arquivo?
O próprio site da Common Crawl descreve o corpus como gratuito e aberto, sem login nem taxa necessários para baixar um rastreamento. Esse acesso aberto é o que permite que laboratórios externos construam seus próprios conjuntos de dados a partir dele.
Posso bloquear o CCBot apenas em parte do meu site?
Sim. Uma regra disallow dentro do bloco de user agent do CCBot aceita um caminho específico, como Disallow: /private/, então o resto do site permanece aberto para o mesmo rastreador.
RedReplier
Começar
Reddit, X, Bluesky e HN
Alertas de intenção em tempo real
Respostas IA ilimitadas
Classificado por intenção de compra
A Common Crawl é a mesma coisa que o rastreador próprio de uma empresa de IA?
Não. A Common Crawl publica um arquivo aberto que qualquer organização externa pode baixar e filtrar, enquanto um rastreador como o GPTBot rastreia diretamente para seu próprio operador, a OpenAI, para treinar os modelos desse próprio operador.
Com que frequência a Common Crawl publica um novo rastreamento?
O próprio site da Common Crawl afirma que adiciona de 3 a 5 bilhões de páginas novas a cada mês, como parte de um arquivo que roda desde 2007 e hoje tem mais de 300 bilhões de páginas. Uma regra de robots.txt adicionada a qualquer momento se aplica a partir daquele ciclo de rastreamento.
Quais formatos a Common Crawl publica a partir de cada rastreamento?
A Common Crawl publica capturas brutas de páginas web junto com extratos de metadados e extratos de texto de cada rastreamento mensal. Cada um desses downloads é gratuito e sem necessidade de login, assim que a Common Crawl empacota os resultados. O arquivo construído a partir dessas publicações já contém mais de 300 bilhões de páginas desde 2007.
O CCBot precisa de alguma configuração para começar a rastrear um site novo?
O CCBot rastreia um site por padrão, já que o estado padrão usado pela Common Crawl é de acesso aberto sem nenhuma configuração. Um dono de site só precisa agir para bloquear o CCBot, usando a regra de robots.txt de duas linhas que nomeia o user agent do CCBot.
Por que o paper do GPT-3 da OpenAI importa na hora de decidir bloquear o CCBot?
O paper da OpenAI sobre o GPT-3, Brown et al. 2020, lista "Common Crawl (filtrado)" como a maior fonte isolada em sua tabela de dados de treinamento, com 410 bilhões de tokens e 60 por cento da mistura de treinamento do modelo. Esse conjunto filtrado vem de páginas que o CCBot capturou, então uma página que o CCBot nunca rastreia não pode acabar contada em uma tabela como essa.
O que é a verificação de DNS reverso do CCBot?
Os endereços IPv4 publicados do CCBot carregam entradas de DNS reverso funcionais, segundo a própria documentação da Common Crawl. Isso dá a um site uma segunda forma de confirmar a origem de uma requisição, independente de comparar o IP com a lista publicada pela Common Crawl.
Veja-nos mais no Google
Um clique marca a RedReplier como fonte preferida e nossos artigos passam a aparecer mais acima nas suas Principais notícias, no modo IA e nas visões gerais com IA.
Antes de você ir...
RedReplier
Alcance cada comprador que procura o que você vende
O RedReplier monitora Reddit, X, Bluesky e Hacker News em tempo real, classifica cada tópico por intenção de compra e redige a sua resposta, para que você chegue primeiro.
Reddit, X, Bluesky e HN
Alertas de intenção em tempo real
Respostas IA ilimitadas
Classificado por intenção de compra
Artigos relacionados


O rastreador de treinamento de IA da Meta, meta-externalagent, e como bloqueá-lo
A Meta usa o meta-externalagent para coletar páginas públicas e treinar seus modelos de IA. Aqui estão a string exata de user agent e o bloqueio no robots.txt.


Como o ChatGPT-User difere do GPTBot e do OAI-SearchBot
O agente ChatGPT-User da OpenAI busca uma página só se alguém pedir ao ChatGPT para abrir um link, diferente da regra para o GPTBot ou o OAI-SearchBot.


Como o Cloudflare Pay Per Crawl cobra bots de IA por página
O Cloudflare Pay Per Crawl devolve uma resposta HTTP 402 até que um rastreador de IA pague o preço exato por requisição que o próprio dono do site definiu.

