TL;DR
8 minutos de leituraMeta-ExternalAgent é o rastreador que a Meta usa para coletar páginas da web para treinar modelos de IA de base e para indexar conteúdo diretamente, e ele se identifica nos logs do servidor com o token meta-externalagent, segundo a própria documentação de rastreadores da Meta. Um grupo User-agent de duas linhas no robots.txt bloqueia o rastreador em um site inteiro, e a Meta mantém o robots.txt em cache por até 24 horas antes de a mudança valer. A Meta não publica lista de IPs nem método de verificação para esse rastreador, então o robots.txt barra os rastreadores que escolhem obedecê-lo e nada mais.
O que é meta-externalagent?
A Meta opera o meta-externalagent como o rastreador que coleta páginas públicas da web para treinar modelos de IA de base, segundo a documentação Meta Web Crawlers da Meta, atualizada em 21 May 2026 e conferida em 9 September 2026. A redação exata da Meta é que o rastreador "rastreia a web para casos de uso como treinar modelos de IA de base ou melhorar produtos indexando conteúdo diretamente". Um único grupo no robots.txt o controla em um site inteiro, e a Meta afirma que mudanças no robots.txt levam até 24 horas para valer, porque seus rastreadores mantêm o arquivo em cache por esse período.
Qual é a string exata de user agent do meta-externalagent?
A Meta documenta duas formas da string, e ambas começam com o mesmo token em minúsculas:
meta-externalagent/1.1 (+/documentation/sharing/webmasters/web-crawlers)
meta-externalagent/1.1
A Meta apresenta as duas com a frase "A string de UA específica que você verá nos seus arquivos de log será parecida com uma das seguintes", então o sufixo de versão e o caminho entre parênteses não são um contrato estável. Faça seus filtros de log e regras de firewall casarem com a substring meta-externalagent, sem diferenciar maiúsculas de minúsculas, e eles continuam funcionando quando a Meta passar de 1.1 para 1.2.
Como o meta-externalagent difere dos outros rastreadores da Meta?
A Meta opera cinco rastreadores documentados, e cada um tem um token próprio no robots.txt, então bloquear um deixa os outros quatro intactos. Dois deles avisam abertamente que podem ignorar o seu arquivo.
| Rastreador | Token no robots.txt | O que a Meta diz que ele faz | Obedece o robots.txt |
|---|---|---|---|
| Meta-ExternalAgent | meta-externalagent | Treina modelos de IA de base, indexa conteúdo diretamente | Sim |
| Meta-WebIndexer | meta-webindexer | Melhora a qualidade dos resultados de busca do Meta AI, e permiti-lo "nos ajuda a citar e criar links para o seu conteúdo nas respostas do Meta AI" | Sim |
| Meta-ExternalAds | meta-externalads | Melhora publicidade e outros produtos ligados a negócios | Sim |
| Meta-ExternalFetcher | meta-externalfetcher | Busca links individuais a pedido de um usuário, dá suporte a IA agêntica | A Meta afirma que ele "pode ignorar as regras do robots.txt" |
| FacebookExternalHit | facebookexternalhit | Rastreia links compartilhados para montar o título, a descrição e a miniatura da prévia | A Meta afirma que ele "pode ignorar o robots.txt ao realizar verificações de segurança ou integridade" |
O par que vale entender é meta-externalagent contra meta-externalfetcher. O primeiro é um rastreador em massa que percorre a web no cronograma da Meta para montar dados de treinamento. O segundo dispara quando uma pessoa pede ao Meta AI para olhar um link específico, o que o coloca na mesma categoria do buscador acionado pelo usuário da OpenAI, o ChatGPT-User, e a Meta diz que esse pode passar por cima das suas regras. FacebookExternalHit fica à parte dos dois: bloqueie-o e os links para o seu site perdem o cartão de prévia no Facebook, no Instagram e no Messenger.

Como bloquear o meta-externalagent no robots.txt?
Adicione um grupo User-agent nomeando o token e proíba o site inteiro. Coloque isto na raiz do seu domínio, no arquivo servido em /robots.txt:
User-agent: meta-externalagent
Disallow: /
A própria documentação da Meta mostra o mesmo grupo usado no sentido inverso, liberando tudo e recortando um diretório:
User-agent: meta-externalagent
Allow: / # Allow everything
Disallow: /private/ # Disallow a specific directory
Se o seu objetivo é manter suas páginas fora do treinamento de IA em todos os fornecedores, esse grupo é uma linha em um arquivo mais longo que também nomeia o token de exclusão de treinamento da Apple, o Applebot-Extended e o CCBot do Common Crawl. Correspondência de caminhos, curingas e precedência de grupos estão no guia completo de sintaxe do robots.txt, então mantenha os grupos de rastreadores aqui e a mecânica das regras lá.
Bloquear o meta-externalagent realmente detém a Meta?
O bloqueio só funciona porque o rastreador escolhe ler o seu arquivo e obedecê-lo. O robots.txt é uma convenção, não um controle de acesso: seu servidor continua devolvendo 200 para quem pedir, e o padrão não tem execução forçada, autenticação nem punição. A Meta demonstra o limite na própria documentação ao nomear dois rastreadores, meta-externalfetcher e facebookexternalhit, que podem buscar páginas proibidas pelo seu arquivo.
A execução mora no servidor. Uma regra de negação sobre a string de user agent, um bloqueio de IP, uma regra de WAF ou um portão de acesso pago como o pay per crawl da Cloudflare devolve 403 em vez de conteúdo, e essa decisão é sua, não do rastreador.

Dá para verificar se uma requisição do meta-externalagent é mesmo da Meta?
A documentação de rastreadores da Meta não oferece nenhuma forma de verificação. A página não publica faixas de IP, número de sistema autônomo nem regra de DNS reverso confirmado para o meta-externalagent, o que deixa a string de user agent como único identificador, e qualquer cliente na internet consegue enviar esse cabeçalho com uma flag do curl. O único contato que a Meta oferece nessa página é webmasters@meta.com.
Trate a string como um rótulo, não como prova. Se você está aplicando um bloqueio em vez de pedir um, escreva a regra contra o comportamento de requisição que dá para observar, como taxa e padrão de caminhos vindos de um único IP, e reserve a correspondência por user agent para os rastreadores que se identificam com honestidade.
As maiúsculas importam quando você bloqueia o meta-externalagent?
As maiúsculas e minúsculas do nome do rastreador não importam. A RFC 9309 exige que os rastreadores comparem o token de produto de uma linha User-agent sem diferenciar maiúsculas de minúsculas, então meta-externalagent, Meta-ExternalAgent e META-EXTERNALAGENT selecionam o mesmo grupo. A grafia importa: um hífen faltando ou um caractere solto produz um token que não corresponde a nenhum rastreador, e o bloqueio falha sem nenhum erro para avisar você. Os valores de caminho são o caso oposto. A RFC 9309 diz que os caminhos de Disallow e Allow devem ser comparados diferenciando maiúsculas de minúsculas, então /Private/ e /private/ são duas regras distintas.
RedReplier
Começar
Reddit, X, Bluesky e HN
Alertas de intenção em tempo real
Respostas IA ilimitadas
Classificado por intenção de compra
Você deve bloquear o meta-externalagent se quer visibilidade em IA?
Bloquear o meta-externalagent tira suas páginas da coleta de treinamento de IA da Meta, e não tira você das respostas do Meta AI, porque a Meta atribui citação e criação de links a outro rastreador. A Meta escreve que permitir o Meta-WebIndexer "nos ajuda a citar e criar links para o seu conteúdo nas respostas do Meta AI", então um site que quer citações sem contribuir com dados de treinamento proíbe meta-externalagent e permite meta-webindexer.
Essa separação é uma decisão, e o jeito de conferi-la é medição, não suposição. O monitoramento de marca em LLMs para busca com IA do RedReplier acompanha onde ChatGPT, Claude e Gemini citam sua marca nas respostas, para você observar o que uma mudança no robots.txt faz com as citações em vez de adivinhar.
Perguntas frequentes
meta-externalagent é a mesma coisa que facebookexternalhit?
Não. A Meta os documenta como rastreadores separados, com tokens separados no robots.txt e trabalhos separados. Meta-ExternalAgent rastreia a web para treinar modelos de IA de base e indexar conteúdo, enquanto FacebookExternalHit busca um link que alguém compartilhou no Facebook, no Instagram ou no Messenger para montar título, descrição e miniatura. Proibir um não tem efeito sobre o outro.
Bloquear o meta-externalagent quebra as prévias de link do Facebook?
Não. As prévias de link são produzidas pelo FacebookExternalHit, que lê o token facebookexternalhit no robots.txt. Um grupo que proíbe apenas meta-externalagent deixa o rastreamento de prévias intacto. Se você quer manter as prévias, não adicione facebookexternalhit à sua lista de disallow.
Quanto tempo uma mudança no robots.txt leva para chegar aos rastreadores da Meta?
A documentação da Meta pede que você aguarde até 24 horas, porque seus rastreadores mantêm o conteúdo do robots.txt em cache por esse tempo. Um bloqueio adicionado nesta manhã ainda pode receber acessos de rastreador nesta tarde sem que nada esteja quebrado. Se as requisições continuarem depois de 24 horas, confira se o arquivo é servido na raiz do domínio e devolve 200.
Posso bloquear o meta-externalagent com uma meta tag robots?
A Meta afirma que prefere práticas padrão do setor como o robots.txt a formatos fora do padrão como as tags NoAI, e o único controle de rastreador que sua documentação descreve é o robots.txt. Uma meta tag no nível da página também exige que o rastreador busque e analise a página antes, o que anula o propósito se o seu objetivo é impedir a busca. Use o grupo no robots.txt.
Qual é a diferença entre meta-externalagent e meta-externalfetcher?
Meta-ExternalAgent rastreia de forma ampla no cronograma da própria Meta para montar dados de treinamento e indexação. Meta-ExternalFetcher busca links individuais a pedido de um usuário para dar suporte a recursos de IA agêntica, e a Meta afirma que esse rastreador pode ignorar as regras do robots.txt por esse motivo. Um disallow no robots.txt é, portanto, uma instrução confiável para o primeiro e não confiável para o segundo.
Onde a Meta publica a documentação oficial do meta-externalagent?
A Meta publica em developers.facebook.com, em Sharing, Webmasters, Meta Web Crawlers, no endereço https://developers.facebook.com/documentation/sharing/webmasters/web-crawlers. Essa página lista todos os rastreadores documentados da Meta, as strings de user agent, o exemplo de robots.txt e o contato webmasters@meta.com. Confira antes de escrever regras de firewall, já que a Meta revisa a lista de rastreadores e os sufixos de versão.
A documentação da Meta sobre meta-externalagent está atualizada?
A Meta atualizou sua página Meta Web Crawlers em 21 de maio de 2026, e os dados deste artigo foram conferidos nessa página em 9 de setembro de 2026. Nomes de rastreadores e sufixos de versão mudam com o tempo, então uma regra baseada numa cópia antiga da página pode deixar passar um token novo. Confira a página ao vivo em developers.facebook.com antes de escrever uma regra de firewall.
Com quem falar se o meta-externalagent se comportar mal no seu site?
A Meta lista um único contato para sua documentação de rastreadores, webmasters@meta.com. Essa mesma página não publica lista de IPs, ASN nem método de verificação, então um aviso a esse endereço é seu único canal além do próprio bloqueio no robots.txt. Use esse endereço para comportamento que suas próprias regras de servidor não conseguem controlar.
O meta-externalfetcher é o mesmo tipo de rastreador que o ChatGPT-User?
O Meta-ExternalFetcher age quando alguém pede à Meta AI para olhar um link específico, o mesmo papel que o ChatGPT-User da OpenAI cumpre para o ChatGPT. Os dois respondem a um pedido pontual de um usuário em vez de rastrear amplamente por agenda, o que os separa de rastreadores em massa como o meta-externalagent. A Meta afirma que o meta-externalfetcher pode ignorar o robots.txt, então bloquear o meta-externalagent não muda nada para ele.
Posso permitir o meta-externalagent em parte do meu site em vez de bloqueá-lo por completo?
A própria documentação da Meta mostra um grupo que permite o site inteiro e exclui um diretório, com Allow: / seguido de Disallow: /private/. Você pode aplicar o mesmo padrão a qualquer pasta que queira manter fora do treinamento enquanto deixa o resto aberto. É o mesmo grupo de robots.txt, só que com linhas Allow e Disallow diferentes em vez de um Disallow: / geral.
Veja-nos mais no Google
Um clique marca a RedReplier como fonte preferida e nossos artigos passam a aparecer mais acima nas suas Principais notícias, no modo IA e nas visões gerais com IA.
Antes de você ir...
RedReplier
Alcance cada comprador que procura o que você vende
O RedReplier monitora Reddit, X, Bluesky e Hacker News em tempo real, classifica cada tópico por intenção de compra e redige a sua resposta, para que você chegue primeiro.
Reddit, X, Bluesky e HN
Alertas de intenção em tempo real
Respostas IA ilimitadas
Classificado por intenção de compra
Artigos relacionados


O que o CCBot coleta para o arquivo web aberto da Common Crawl
O CCBot, rastreador da Common Crawl, monta um arquivo web aberto que laboratórios de IA filtram para treinar modelos, e uma regra no robots.txt controla tudo.


Como o ChatGPT-User difere do GPTBot e do OAI-SearchBot
O agente ChatGPT-User da OpenAI busca uma página só se alguém pedir ao ChatGPT para abrir um link, diferente da regra para o GPTBot ou o OAI-SearchBot.


Como o Cloudflare Pay Per Crawl cobra bots de IA por página
O Cloudflare Pay Per Crawl devolve uma resposta HTTP 402 até que um rastreador de IA pague o preço exato por requisição que o próprio dono do site definiu.

