glossary

O rastreador de treinamento de IA da Meta, meta-externalagent, e como bloqueá-lo

Taras Shynkarenko
Taras Shynkarenko
Updated: 8 minutos de leitura
O rastreador de treinamento de IA da Meta, meta-externalagent, e como bloqueá-loO rastreador de treinamento de IA da Meta, meta-externalagent, e como bloqueá-lo

TL;DR

8 minutos de leitura

Meta-ExternalAgent é o rastreador que a Meta usa para coletar páginas da web para treinar modelos de IA de base e para indexar conteúdo diretamente, e ele se identifica nos logs do servidor com o token meta-externalagent, segundo a própria documentação de rastreadores da Meta. Um grupo User-agent de duas linhas no robots.txt bloqueia o rastreador em um site inteiro, e a Meta mantém o robots.txt em cache por até 24 horas antes de a mudança valer. A Meta não publica lista de IPs nem método de verificação para esse rastreador, então o robots.txt barra os rastreadores que escolhem obedecê-lo e nada mais.

O que é meta-externalagent?

A Meta opera o meta-externalagent como o rastreador que coleta páginas públicas da web para treinar modelos de IA de base, segundo a documentação Meta Web Crawlers da Meta, atualizada em 21 May 2026 e conferida em 9 September 2026. A redação exata da Meta é que o rastreador "rastreia a web para casos de uso como treinar modelos de IA de base ou melhorar produtos indexando conteúdo diretamente". Um único grupo no robots.txt o controla em um site inteiro, e a Meta afirma que mudanças no robots.txt levam até 24 horas para valer, porque seus rastreadores mantêm o arquivo em cache por esse período.

Qual é a string exata de user agent do meta-externalagent?

A Meta documenta duas formas da string, e ambas começam com o mesmo token em minúsculas:

meta-externalagent/1.1 (+/documentation/sharing/webmasters/web-crawlers)
meta-externalagent/1.1

A Meta apresenta as duas com a frase "A string de UA específica que você verá nos seus arquivos de log será parecida com uma das seguintes", então o sufixo de versão e o caminho entre parênteses não são um contrato estável. Faça seus filtros de log e regras de firewall casarem com a substring meta-externalagent, sem diferenciar maiúsculas de minúsculas, e eles continuam funcionando quando a Meta passar de 1.1 para 1.2.

Como o meta-externalagent difere dos outros rastreadores da Meta?

A Meta opera cinco rastreadores documentados, e cada um tem um token próprio no robots.txt, então bloquear um deixa os outros quatro intactos. Dois deles avisam abertamente que podem ignorar o seu arquivo.

RastreadorToken no robots.txtO que a Meta diz que ele fazObedece o robots.txt
Meta-ExternalAgentmeta-externalagentTreina modelos de IA de base, indexa conteúdo diretamenteSim
Meta-WebIndexermeta-webindexerMelhora a qualidade dos resultados de busca do Meta AI, e permiti-lo "nos ajuda a citar e criar links para o seu conteúdo nas respostas do Meta AI"Sim
Meta-ExternalAdsmeta-externaladsMelhora publicidade e outros produtos ligados a negóciosSim
Meta-ExternalFetchermeta-externalfetcherBusca links individuais a pedido de um usuário, dá suporte a IA agênticaA Meta afirma que ele "pode ignorar as regras do robots.txt"
FacebookExternalHitfacebookexternalhitRastreia links compartilhados para montar o título, a descrição e a miniatura da préviaA Meta afirma que ele "pode ignorar o robots.txt ao realizar verificações de segurança ou integridade"

O par que vale entender é meta-externalagent contra meta-externalfetcher. O primeiro é um rastreador em massa que percorre a web no cronograma da Meta para montar dados de treinamento. O segundo dispara quando uma pessoa pede ao Meta AI para olhar um link específico, o que o coloca na mesma categoria do buscador acionado pelo usuário da OpenAI, o ChatGPT-User, e a Meta diz que esse pode passar por cima das suas regras. FacebookExternalHit fica à parte dos dois: bloqueie-o e os links para o seu site perdem o cartão de prévia no Facebook, no Instagram e no Messenger.

Um rack de servidores em um data center, representando a infraestrutura onde um arquivo robots.txt fica na raiz do domínio.

Como bloquear o meta-externalagent no robots.txt?

Adicione um grupo User-agent nomeando o token e proíba o site inteiro. Coloque isto na raiz do seu domínio, no arquivo servido em /robots.txt:

User-agent: meta-externalagent
Disallow: /

A própria documentação da Meta mostra o mesmo grupo usado no sentido inverso, liberando tudo e recortando um diretório:

User-agent: meta-externalagent
Allow: /                    # Allow everything
Disallow: /private/         # Disallow a specific directory

Se o seu objetivo é manter suas páginas fora do treinamento de IA em todos os fornecedores, esse grupo é uma linha em um arquivo mais longo que também nomeia o token de exclusão de treinamento da Apple, o Applebot-Extended e o CCBot do Common Crawl. Correspondência de caminhos, curingas e precedência de grupos estão no guia completo de sintaxe do robots.txt, então mantenha os grupos de rastreadores aqui e a mecânica das regras lá.

Bloquear o meta-externalagent realmente detém a Meta?

O bloqueio só funciona porque o rastreador escolhe ler o seu arquivo e obedecê-lo. O robots.txt é uma convenção, não um controle de acesso: seu servidor continua devolvendo 200 para quem pedir, e o padrão não tem execução forçada, autenticação nem punição. A Meta demonstra o limite na própria documentação ao nomear dois rastreadores, meta-externalfetcher e facebookexternalhit, que podem buscar páginas proibidas pelo seu arquivo.

A execução mora no servidor. Uma regra de negação sobre a string de user agent, um bloqueio de IP, uma regra de WAF ou um portão de acesso pago como o pay per crawl da Cloudflare devolve 403 em vez de conteúdo, e essa decisão é sua, não do rastreador.

Uma lupa sobre a tela de um notebook, evocando a tentativa de verificar quem está realmente por trás de uma requisição de rastreamento.

Do pedido educado à aplicação forçada
1
Bloqueio no robots.txt. Só funciona se o rastreador ler o arquivo e respeitá-lo.
2
Regra de bloqueio no user agent. O servidor rejeita qualquer requisição que se identifique como meta-externalagent.
3
Bloqueio por IP. O servidor rejeita requisições vindas de faixas que você mesmo identificou.
4
Regra de WAF. Um firewall de aplicação web filtra pelo padrão da requisição, não pela palavra do rastreador.
5
Barreira paga. Um sistema como o pay per crawl da Cloudflare retorna 403 até o pagamento ser confirmado.
O robots.txt só funciona se o rastreador cooperar, tudo o que vem depois é o servidor dizendo não por conta própria.

Dá para verificar se uma requisição do meta-externalagent é mesmo da Meta?

A documentação de rastreadores da Meta não oferece nenhuma forma de verificação. A página não publica faixas de IP, número de sistema autônomo nem regra de DNS reverso confirmado para o meta-externalagent, o que deixa a string de user agent como único identificador, e qualquer cliente na internet consegue enviar esse cabeçalho com uma flag do curl. O único contato que a Meta oferece nessa página é webmasters@meta.com.

Trate a string como um rótulo, não como prova. Se você está aplicando um bloqueio em vez de pedir um, escreva a regra contra o comportamento de requisição que dá para observar, como taxa e padrão de caminhos vindos de um único IP, e reserve a correspondência por user agent para os rastreadores que se identificam com honestidade.

As maiúsculas importam quando você bloqueia o meta-externalagent?

As maiúsculas e minúsculas do nome do rastreador não importam. A RFC 9309 exige que os rastreadores comparem o token de produto de uma linha User-agent sem diferenciar maiúsculas de minúsculas, então meta-externalagent, Meta-ExternalAgent e META-EXTERNALAGENT selecionam o mesmo grupo. A grafia importa: um hífen faltando ou um caractere solto produz um token que não corresponde a nenhum rastreador, e o bloqueio falha sem nenhum erro para avisar você. Os valores de caminho são o caso oposto. A RFC 9309 diz que os caminhos de Disallow e Allow devem ser comparados diferenciando maiúsculas de minúsculas, então /Private/ e /private/ são duas regras distintas.

RedReplier
RedReplier

Começar

Reddit, X, Bluesky e HN

Alertas de intenção em tempo real

Respostas IA ilimitadas

Classificado por intenção de compra

Você deve bloquear o meta-externalagent se quer visibilidade em IA?

Bloquear o meta-externalagent tira suas páginas da coleta de treinamento de IA da Meta, e não tira você das respostas do Meta AI, porque a Meta atribui citação e criação de links a outro rastreador. A Meta escreve que permitir o Meta-WebIndexer "nos ajuda a citar e criar links para o seu conteúdo nas respostas do Meta AI", então um site que quer citações sem contribuir com dados de treinamento proíbe meta-externalagent e permite meta-webindexer.

Essa separação é uma decisão, e o jeito de conferi-la é medição, não suposição. O monitoramento de marca em LLMs para busca com IA do RedReplier acompanha onde ChatGPT, Claude e Gemini citam sua marca nas respostas, para você observar o que uma mudança no robots.txt faz com as citações em vez de adivinhar.

Perguntas frequentes

meta-externalagent é a mesma coisa que facebookexternalhit?

Não. A Meta os documenta como rastreadores separados, com tokens separados no robots.txt e trabalhos separados. Meta-ExternalAgent rastreia a web para treinar modelos de IA de base e indexar conteúdo, enquanto FacebookExternalHit busca um link que alguém compartilhou no Facebook, no Instagram ou no Messenger para montar título, descrição e miniatura. Proibir um não tem efeito sobre o outro.

Não. As prévias de link são produzidas pelo FacebookExternalHit, que lê o token facebookexternalhit no robots.txt. Um grupo que proíbe apenas meta-externalagent deixa o rastreamento de prévias intacto. Se você quer manter as prévias, não adicione facebookexternalhit à sua lista de disallow.

Quanto tempo uma mudança no robots.txt leva para chegar aos rastreadores da Meta?

A documentação da Meta pede que você aguarde até 24 horas, porque seus rastreadores mantêm o conteúdo do robots.txt em cache por esse tempo. Um bloqueio adicionado nesta manhã ainda pode receber acessos de rastreador nesta tarde sem que nada esteja quebrado. Se as requisições continuarem depois de 24 horas, confira se o arquivo é servido na raiz do domínio e devolve 200.

Posso bloquear o meta-externalagent com uma meta tag robots?

A Meta afirma que prefere práticas padrão do setor como o robots.txt a formatos fora do padrão como as tags NoAI, e o único controle de rastreador que sua documentação descreve é o robots.txt. Uma meta tag no nível da página também exige que o rastreador busque e analise a página antes, o que anula o propósito se o seu objetivo é impedir a busca. Use o grupo no robots.txt.

Qual é a diferença entre meta-externalagent e meta-externalfetcher?

Meta-ExternalAgent rastreia de forma ampla no cronograma da própria Meta para montar dados de treinamento e indexação. Meta-ExternalFetcher busca links individuais a pedido de um usuário para dar suporte a recursos de IA agêntica, e a Meta afirma que esse rastreador pode ignorar as regras do robots.txt por esse motivo. Um disallow no robots.txt é, portanto, uma instrução confiável para o primeiro e não confiável para o segundo.

Onde a Meta publica a documentação oficial do meta-externalagent?

A Meta publica em developers.facebook.com, em Sharing, Webmasters, Meta Web Crawlers, no endereço https://developers.facebook.com/documentation/sharing/webmasters/web-crawlers. Essa página lista todos os rastreadores documentados da Meta, as strings de user agent, o exemplo de robots.txt e o contato webmasters@meta.com. Confira antes de escrever regras de firewall, já que a Meta revisa a lista de rastreadores e os sufixos de versão.

A documentação da Meta sobre meta-externalagent está atualizada?

A Meta atualizou sua página Meta Web Crawlers em 21 de maio de 2026, e os dados deste artigo foram conferidos nessa página em 9 de setembro de 2026. Nomes de rastreadores e sufixos de versão mudam com o tempo, então uma regra baseada numa cópia antiga da página pode deixar passar um token novo. Confira a página ao vivo em developers.facebook.com antes de escrever uma regra de firewall.

Com quem falar se o meta-externalagent se comportar mal no seu site?

A Meta lista um único contato para sua documentação de rastreadores, webmasters@meta.com. Essa mesma página não publica lista de IPs, ASN nem método de verificação, então um aviso a esse endereço é seu único canal além do próprio bloqueio no robots.txt. Use esse endereço para comportamento que suas próprias regras de servidor não conseguem controlar.

O meta-externalfetcher é o mesmo tipo de rastreador que o ChatGPT-User?

O Meta-ExternalFetcher age quando alguém pede à Meta AI para olhar um link específico, o mesmo papel que o ChatGPT-User da OpenAI cumpre para o ChatGPT. Os dois respondem a um pedido pontual de um usuário em vez de rastrear amplamente por agenda, o que os separa de rastreadores em massa como o meta-externalagent. A Meta afirma que o meta-externalfetcher pode ignorar o robots.txt, então bloquear o meta-externalagent não muda nada para ele.

Posso permitir o meta-externalagent em parte do meu site em vez de bloqueá-lo por completo?

A própria documentação da Meta mostra um grupo que permite o site inteiro e exclui um diretório, com Allow: / seguido de Disallow: /private/. Você pode aplicar o mesmo padrão a qualquer pasta que queira manter fora do treinamento enquanto deixa o resto aberto. É o mesmo grupo de robots.txt, só que com linhas Allow e Disallow diferentes em vez de um Disallow: / geral.

Veja-nos mais no Google

Um clique marca a RedReplier como fonte preferida e nossos artigos passam a aparecer mais acima nas suas Principais notícias, no modo IA e nas visões gerais com IA.

Antes de você ir...

RedReplier

RedReplier

Alcance cada comprador que procura o que você vende

O RedReplier monitora Reddit, X, Bluesky e Hacker News em tempo real, classifica cada tópico por intenção de compra e redige a sua resposta, para que você chegue primeiro.

Reddit, X, Bluesky e HN

Alertas de intenção em tempo real

Respostas IA ilimitadas

Classificado por intenção de compra

Artigos relacionados