glossary

Bloquear OAI-SearchBot vs GPTBot custa duas coisas diferentes

Taras Shynkarenko
Taras Shynkarenko
Updated: 9 minutos de leitura
Bloquear OAI-SearchBot vs GPTBot custa duas coisas diferentesBloquear OAI-SearchBot vs GPTBot custa duas coisas diferentes

TL;DR

9 minutos de leitura

A OpenAI documenta três agentes web com três funções: GPTBot rastreia para treinar modelos de IA generativa de base, OAI-SearchBot rastreia para mostrar sites no recurso de busca do ChatGPT e ChatGPT-User busca uma única página que uma pessoa pediu ao ChatGPT para abrir. Proibir o GPTBot tira suas páginas da entrada de treinamento sem tocar na busca do ChatGPT, e proibir o OAI-SearchBot tira você da superfície que as pessoas leem e clicam. Quem quer ficar fora do treinamento e manter o tráfego deve nomear apenas o GPTBot.

Qual é a diferença entre OAI-SearchBot vs GPTBot?

A OpenAI opera OAI-SearchBot vs GPTBot como dois rastreadores com duas funções sem relação entre si: OAI-SearchBot busca páginas para o recurso de busca do ChatGPT poder mostrá-las, e GPTBot busca páginas para treinar os modelos de IA generativa de base da OpenAI, segundo a própria documentação de bots da OpenAI em developers.openai.com, conferida em 9 September 2026. Cada um lê o bloco com seu próprio nome no robots.txt, e uma regra escrita para um não tem efeito sobre o outro. Essa separação é o ponto central do desenho: a OpenAI afirma que "usa as tags de robots.txt OAI-SearchBot e GPTBot para permitir que os webmasters gerenciem como seus sites e conteúdos funcionam com IA".

Quais são as strings exatas de user agent dos rastreadores da OpenAI?

A OpenAI publica a string completa de user agent de cada agente que opera, e cada uma carrega uma URL autodescritiva que você pode conferir. Copie estas caractere por caractere quando escrever um filtro de log, porque uma correspondência por substring apenas em GPT vai capturar três agentes diferentes de uma vez.

AgenteString completa de user agentFaixas de IP publicadas
GPTBotMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbotopenai.com/gptbot.json
OAI-SearchBotMozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; +https://openai.com/searchbotopenai.com/searchbot.json
ChatGPT-UserMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/botopenai.com/chatgpt-user.json
OAI-AdsBotMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-AdsBot/1.0; +https://openai.com/adsbotopenai.com/adsbot.json

OAI-SearchBot também envia uma segunda variante documentada, que insere o token robots.txt antes da URL: Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; robots.txt; +https://openai.com/searchbot. Escreva seu filtro de log contra o token puro OAI-SearchBot para as duas variantes caírem no mesmo balde.

Um desenvolvedor edita o arquivo robots.txt de um site, ilustrando a escolha de qual bot da OpenAI bloquear.

Qual bot da OpenAI você deve realmente bloquear?

Bloqueie aquele cuja saída você não quer, e a coluna de custo abaixo é a parte que os donos de site pulam. A OpenAI liga cada agente a uma superfície de produto diferente, então as três regras compram três resultados diferentes.

AgentePara que a OpenAI o usaO que bloqueá-lo custa a vocêDiretiva no robots.txt
GPTBotRastreia conteúdo para treinar modelos de IA generativa de baseSuas páginas param de alimentar o treinamento futuro de modelos por esse rastreamento. A busca do ChatGPT não é afetada.User-agent: GPTBot e depois Disallow: /
OAI-SearchBotAlimenta os recursos de busca do ChatGPT para mostrar sites nos resultadosA OpenAI afirma que sites que optaram por sair "não serão exibidos nas respostas de busca do ChatGPT, embora ainda possam aparecer como links de navegação".User-agent: OAI-SearchBot e depois Disallow: /
ChatGPT-UserCuida de ações iniciadas pelo usuário no ChatGPT e em GPTs personalizadosO ChatGPT não consegue abrir sua página quando uma pessoa cola o link e pergunta sobre ele. A OpenAI observa que as regras do robots.txt podem não valer aqui, porque a requisição segue uma ação ao vivo do usuário.User-agent: ChatGPT-User e depois Disallow: /

O comportamento completo desse terceiro agente, incluindo por que uma regra de robots.txt age de forma diferente em uma busca acionada pelo usuário, está na página dedicada ao ChatGPT-User.

Por que a maioria dos donos de site bloqueia o errado?

O erro é tratar "bloquear os rastreadores de IA" como uma decisão só, quando a OpenAI a construiu como duas. GPTBot é o nome que as pessoas reconhecem da cobertura sobre dados de treinamento de IA, então ele entra em uma regra geral ao lado do OAI-SearchBot, e essa regra geral tira o site da superfície que manda leitores de verdade. O tráfego vindo do recurso de busca do ChatGPT depende de o OAI-SearchBot ter permissão para ler a página que ele cita; a entrada de treinamento não manda ninguém ao seu site. Decida as duas questões separadamente, depois escreva dois bloqueios.

Que robots.txt copiar para cada intenção?

Escolha a intenção que combina com o seu negócio e cole o bloco correspondente na raiz do seu domínio. Cada grupo User-agent funciona sozinho, então uma diretiva sob um nome nunca alcança outro.

Ficar fora do treinamento de modelos e manter o tráfego da busca do ChatGPT. Esta é a configuração que a maioria dos veículos e sites SaaS quer:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

Sair da OpenAI por completo, incluindo a superfície de busca e as buscas pedidas por usuários:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

Liberar tudo, menos os caminhos que nunca deveriam chegar a um modelo ou a uma resposta:

User-agent: GPTBot
Disallow: /members/
Disallow: /checkout/
Disallow: /account/

User-agent: OAI-SearchBot
Disallow: /members/
Disallow: /checkout/
Disallow: /account/

As regras de precedência que decidem qual linha vence quando Allow e Disallow correspondem à mesma URL estão na referência completa de robots.txt.

O robots.txt é imposto ou apenas respeitado?

O robots.txt é respeitado por convenção e imposto por nada. A RFC 9309, o padrão do Robots Exclusion Protocol publicado em setembro de 2022, afirma sem rodeios nas suas Security Considerations que "o Robots Exclusion Protocol não substitui medidas válidas de segurança de conteúdo", e sua seção de abertura observa que essas regras "não são uma forma de autorização de acesso". Uma linha Disallow é um pedido que um rastreador bem-comportado lê antes de buscar, e que um mal-comportado pode ignorar sem nenhuma consequência técnica. Se uma página não pode ser lida por ninguém fora da sua área logada, coloque-a atrás de autenticação ou de uma regra de IP no servidor, e trate a entrada no robots.txt como documentação de intenção para os rastreadores que de fato cumprem.

Fileiras de racks de servidores em um data center, representando a infraestrutura que registra e verifica os IPs dos rastreadores.

Como verificar que uma requisição veio mesmo da OpenAI?

Compare o endereço IP de origem com os arquivos JSON que a OpenAI publica, porque uma string de user agent é um cabeçalho que qualquer cliente pode digitar. A OpenAI lista as faixas atuais em openai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json e openai.com/adsbot.json, e cada arquivo traz um campo creationTime e um array de prefixos CIDR. Conferido em 9 September 2026, openai.com/searchbot.json listava 35 prefixos IPv4 com creationTime de 2026-01-02, e openai.com/gptbot.json listava 21 prefixos com creationTime de 2025-10-30. Rebusque o arquivo em uma rotina em vez de fixar as faixas no código, e trate qualquer requisição que carregue um token da OpenAI vinda de um endereço fora da lista atual como falsificação, não como um rastreador ignorando suas regras.

RedReplier
RedReplier

Começar

Reddit, X, Bluesky e HN

Alertas de intenção em tempo real

Respostas IA ilimitadas

Classificado por intenção de compra

Quanto tempo uma mudança no robots.txt leva para chegar à OpenAI?

A documentação da OpenAI afirma que, para os resultados de busca, "pode levar cerca de 24 horas desde a atualização do robots.txt de um site até nossos sistemas se ajustarem". Esse atraso vale para a superfície de busca, então um site que muda o OAI-SearchBot de proibido para permitido deve esperar cerca de um dia até o comportamento da busca do ChatGPT refletir isso. Publique a mudança, anote o horário e segure uma segunda edição até passar um dia inteiro, porque duas mudanças dentro da janela de propagação tornam o resultado impossível de ler.

Bloqueie o agente certo e depois confirme que funcionou
1
Decida o alvo. O GPTBot alimenta o treinamento de modelos, o OAI-SearchBot alimenta a busca do ChatGPT. Escolha um, os dois ou nenhum.
2
Escreva um bloco separado para cada agente. Uma regra sob um nome de user agent nunca alcança outro.
3
Espere cerca de 24 horas. A documentação da OpenAI diz que seus sistemas levam cerca de um dia para refletir uma mudança no robots.txt na busca.
4
Confira o IP de origem, não só o user agent. Compare as requisições com os intervalos CIDR publicados pela OpenAI antes de confiar em uma linha de log.
Cada etapa fecha a brecha deixada pela anterior, da escolha do agente até a confirmação de que o bloqueio realmente funcionou.

O que acompanhar depois de definir as regras?

Acompanhe se o ChatGPT de fato cita você, porque um robots.txt correto é uma entrada e uma citação é o resultado. O monitoramento de marca em busca com IA observa onde ChatGPT, Claude e Gemini mencionam uma marca nas respostas, que é a única leitura direta de se permitir o OAI-SearchBot comprou alguma coisa. A mesma divisão entre treinamento e busca aparece nas pilhas de outros fornecedores: Applebot-Extended é a exclusão de treinamento da Apple que deixa Siri, Spotlight e a busca do Safari intactos, e CCBot é o arquivo aberto do Common Crawl que laboratórios externos filtram para dentro de conjuntos de treinamento. Ser citado é uma disciplina separada de ser rastreado, e é disso que trata a otimização para motores de resposta.

Perguntas frequentes

Bloquear o GPTBot me tira da busca do ChatGPT?

Não. A OpenAI documenta o GPTBot como o rastreador para treinar modelos de IA generativa de base e o OAI-SearchBot como o rastreador que alimenta os recursos de busca do ChatGPT. Um Disallow sob User-agent: GPTBot deixa o OAI-SearchBot livre para rastrear, então a busca do ChatGPT ainda pode mostrar e citar suas páginas.

O que acontece se eu bloquear o OAI-SearchBot?

A OpenAI afirma que sites que optaram por sair do OAI-SearchBot "não serão exibidos nas respostas de busca do ChatGPT, embora ainda possam aparecer como links de navegação". Você perde a citação e o clique que vem junto. A OpenAI recomenda permitir o OAI-SearchBot no robots.txt para ajudar um site a aparecer nos resultados de busca.

Existe uma diretiva única que bloqueia todos os bots da OpenAI de uma vez?

Nenhum token cobre todos. A OpenAI documenta GPTBot, OAI-SearchBot, ChatGPT-User e OAI-AdsBot como tokens de user-agent separados no robots.txt, e cada um precisa do seu próprio grupo nomeado. Um grupo curinga User-agent: * vale para rastreadores em conformidade que não encontram um grupo com seu nome, então um agente com bloco próprio lê esse bloco.

Qual agente da OpenAI não é um rastreador?

ChatGPT-User. A OpenAI o documenta como responsável por ações iniciadas pelo usuário no ChatGPT e em GPTs personalizados, ou seja, ele busca uma página porque uma pessoa pediu ao ChatGPT para abrir aquele link. A OpenAI observa que as regras do robots.txt podem não valer para ele da mesma forma, já que a requisição depende de uma ação ao vivo do usuário.

O que o OAI-AdsBot faz?

A OpenAI documenta o OAI-AdsBot como o agente que valida a segurança de páginas enviadas como anúncios do ChatGPT, e afirma que "os dados coletados pelo OAI-AdsBot não são usados para treinar modelos de IA generativa de base". Ele tem seu próprio token no robots.txt e sua própria lista de IPs publicada em openai.com/adsbot.json. É separado tanto do rastreamento de treinamento quanto do de busca.

Um rastreador pode ignorar meu arquivo robots.txt?

Pode. A RFC 9309 descreve o Robots Exclusion Protocol como um conjunto de regras que os rastreadores leem, e sua seção Security Considerations afirma que o protocolo "não substitui medidas válidas de segurança de conteúdo". Nada no protocolo bloqueia uma requisição na camada de rede, então tudo que precisa ficar privado exige autenticação ou um bloqueio no servidor.

Vale codificar os intervalos de IP publicados pela OpenAI em vez de buscá-los de novo?

Os arquivos de intervalos de IP da OpenAI trazem um campo creationTime que muda sempre que o intervalo é atualizado, então uma cópia fixa fica desatualizada assim que a OpenAI rotaciona sua infraestrutura. Busque novamente openai.com/gptbot.json, searchbot.json, chatgpt-user.json ou adsbot.json em um cronograma, e trate qualquer requisição com um user agent da OpenAI vinda de um endereço fora da lista atual como uma falsificação, não como um rastreador ignorando o robots.txt.

Por que não fazer uma segunda mudança no robots.txt logo após a primeira?

A documentação da OpenAI fixa o tempo de propagação para a busca em cerca de 24 horas após uma atualização do robots.txt. Uma segunda mudança dentro dessa janela chega antes de a primeira terminar de fazer efeito, então o resultado visto depois não pode ser atribuído com certeza a nenhuma das duas. Aplique uma mudança, anote o horário, e espere o dia inteiro passar antes de mexer no arquivo de novo.

A RFC 9309 afirma em sua seção inicial que as regras do robots.txt "não são uma forma de autorização de acesso". Uma linha Disallow pede a um rastreador que segue as regras para pular uma página, mas não tem nenhum mecanismo contra um que não segue. Conteúdo que realmente precisa de proteção deve ficar atrás de um login ou de uma regra de IP no servidor, com a entrada no robots.txt servindo só como registro de intenção.

As regras do GPTBot e do OAI-SearchBot podem conviver no mesmo arquivo robots.txt?

Podem, e essa combinação, Disallow para o GPTBot e Allow para o OAI-SearchBot, é exatamente o que a separação da OpenAI torna possível para sites que querem sair do treinamento e ainda manter o tráfego da busca do ChatGPT. Cada grupo de User-agent é lido separadamente, então o bloco do GPTBot e o do OAI-SearchBot nunca interferem um no outro dentro do mesmo arquivo.

Veja-nos mais no Google

Um clique marca a RedReplier como fonte preferida e nossos artigos passam a aparecer mais acima nas suas Principais notícias, no modo IA e nas visões gerais com IA.

Antes de você ir...

RedReplier

RedReplier

Alcance cada comprador que procura o que você vende

O RedReplier monitora Reddit, X, Bluesky e Hacker News em tempo real, classifica cada tópico por intenção de compra e redige a sua resposta, para que você chegue primeiro.

Reddit, X, Bluesky e HN

Alertas de intenção em tempo real

Respostas IA ilimitadas

Classificado por intenção de compra

Artigos relacionados