TL;DR
8 lecture min.Meta-ExternalAgent est le crawler que Meta utilise pour collecter des pages web afin d'entraîner ses modèles IA de fondation et d'indexer le contenu directement, et il s'identifie dans les logs serveur avec le token meta-externalagent, d'après la documentation web crawler de Meta. Un groupe User-agent de deux lignes dans robots.txt le bloque sur tout un site, et Meta met robots.txt en cache jusqu'à 24 heures avant que le changement prenne effet. Meta ne publie ni liste d'IP ni méthode de vérification pour ce crawler, donc robots.txt arrête les crawlers qui choisissent de s'y plier et rien d'autre.
Qu'est-ce que meta-externalagent ?
Meta exploite meta-externalagent comme le crawler qui collecte les pages web publiques pour entraîner ses modèles IA de fondation, d'après la documentation Meta Web Crawlers de Meta, mise à jour le 21 May 2026 et vérifiée le 9 September 2026. La formulation exacte de Meta est que le crawler "parcourt le web pour des cas d'usage tels que l'entraînement de modèles IA de fondation ou l'amélioration des produits par l'indexation directe du contenu". Un seul groupe robots.txt le contrôle pour un site entier, et Meta indique que les modifications de robots.txt mettent jusqu'à 24 heures à prendre effet parce que ses crawlers gardent le fichier en cache pendant cette durée.
Quelle est la chaîne user agent exacte de meta-externalagent ?
Meta documente deux formes de la chaîne, et toutes deux commencent par le même token en minuscules :
meta-externalagent/1.1 (+/documentation/sharing/webmasters/web-crawlers)
meta-externalagent/1.1
Meta les introduit par la phrase "La chaîne UA précise que vous verrez dans vos fichiers journaux ressemblera à l'une des suivantes", donc le suffixe de version et le chemin entre parenthèses ne constituent pas un contrat stable. Faites porter vos filtres de logs et vos règles de pare-feu sur la sous-chaîne meta-externalagent, sans tenir compte de la casse, et ils continueront de fonctionner quand Meta passera de 1.1 à 1.2.
En quoi meta-externalagent diffère-t-il des autres crawlers de Meta ?
Meta fait tourner cinq crawlers documentés, et chacun possède un token robots.txt distinct, donc en bloquer un laisse les quatre autres intacts. Deux d'entre eux vous disent franchement qu'ils peuvent ignorer votre fichier.
| Crawler | Token robots.txt | Ce que Meta dit qu'il fait | Respecte robots.txt |
|---|---|---|---|
| Meta-ExternalAgent | meta-externalagent | Entraîne les modèles IA de fondation, indexe le contenu directement | Oui |
| Meta-WebIndexer | meta-webindexer | Améliore la qualité des résultats de recherche de Meta AI, et l'autoriser "nous aide à citer votre contenu et à créer des liens vers lui dans les réponses de Meta AI" | Oui |
| Meta-ExternalAds | meta-externalads | Améliore la publicité et d'autres produits liés aux entreprises | Oui |
| Meta-ExternalFetcher | meta-externalfetcher | Récupère des liens individuels à la demande d'un utilisateur, prend en charge l'IA agentique | Meta indique qu'il "peut contourner les règles robots.txt" |
| FacebookExternalHit | facebookexternalhit | Explore les liens partagés pour construire le titre, la description et la vignette d'aperçu | Meta indique qu'il "peut contourner robots.txt lors de contrôles de sécurité ou d'intégrité" |
La paire qui mérite d'être comprise oppose meta-externalagent à meta-externalfetcher. Le premier est un crawler de masse qui parcourt le web au rythme de Meta pour constituer des données d'entraînement. Le second se déclenche quand une personne demande à Meta AI de regarder un lien précis, ce qui le place dans la même catégorie que le fetcher déclenché par l'utilisateur d'OpenAI, ChatGPT-User, et Meta dit que celui-là peut contourner vos règles. FacebookExternalHit se tient à part des deux : bloquez-le et les liens vers votre site perdent leur carte d'aperçu sur Facebook, Instagram et Messenger.

Comment bloquer meta-externalagent dans robots.txt ?
Ajoutez un groupe User-agent qui nomme le token et interdisez tout le site. Placez ceci à la racine de votre domaine, dans le fichier servi à /robots.txt :
User-agent: meta-externalagent
Disallow: /
La documentation de Meta montre le même groupe utilisé dans l'autre sens, en autorisant tout et en découpant un répertoire :
User-agent: meta-externalagent
Allow: / # Allow everything
Disallow: /private/ # Disallow a specific directory
Si votre objectif est de tenir vos pages hors de l'entraînement IA chez tous les fournisseurs, ce groupe est une ligne dans un fichier plus long qui nomme aussi le token de refus d'entraînement d'Apple, Applebot-Extended et le CCBot de Common Crawl. La correspondance de chemins, les caractères génériques et la précédence des groupes sont traités dans le guide complet de la syntaxe robots.txt, alors gardez les groupes de crawlers ici et la mécanique des règles là-bas.
Bloquer meta-externalagent arrête-t-il vraiment Meta ?
Le blocage ne fonctionne que parce que le crawler choisit de lire votre fichier et de s'y plier. Robots.txt est une convention, pas un contrôle d'accès : votre serveur renvoie toujours 200 à qui le demande, et le standard n'a ni application, ni authentification, ni sanction. Meta démontre la limite dans sa propre documentation en nommant deux crawlers, meta-externalfetcher et facebookexternalhit, capables de récupérer des pages que votre fichier interdit.
L'application se joue au niveau du serveur. Une règle de refus sur la chaîne user agent, un blocage d'IP, une règle WAF ou un péage d'accès comme le pay per crawl de Cloudflare renvoient 403 au lieu du contenu, et cette décision vous appartient, pas au crawler.

Peut-on vérifier qu'une requête de meta-externalagent vient bien de Meta ?
La documentation crawler de Meta ne donne aucun moyen de le vérifier. La page ne publie ni plages d'IP, ni numéro de système autonome, ni règle de DNS inverse confirmé pour meta-externalagent, ce qui laisse la chaîne user agent comme seul identifiant, et n'importe quel client sur internet peut envoyer cet en-tête avec un seul drapeau curl. Le seul contact que Meta propose sur cette page est webmasters@meta.com.
Traitez la chaîne comme une étiquette, pas comme une preuve. Si vous appliquez un blocage au lieu de le demander, écrivez la règle contre un comportement de requête observable, comme le rythme et le motif de chemins depuis une même IP, et réservez la correspondance sur user agent aux crawlers qui s'identifient honnêtement.
La casse compte-t-elle quand on bloque meta-externalagent ?
La casse du nom du crawler ne compte pas. La RFC 9309 exige que les crawlers comparent le token de produit d'une ligne User-agent sans tenir compte de la casse, donc meta-externalagent, Meta-ExternalAgent et META-EXTERNALAGENT sélectionnent tous le même groupe. L'orthographe, elle, compte : un trait d'union manquant ou un caractère parasite produit un token qui ne correspond à aucun crawler, et le blocage échoue sans la moindre erreur pour vous le signaler. Les valeurs de chemin sont le cas inverse. La RFC 9309 dit que les chemins Disallow et Allow doivent être comparés en tenant compte de la casse, donc /Private/ et /private/ sont deux règles différentes.
RedReplier
Commencer
Reddit, X, Bluesky et HN
Alertes d'intention en temps réel
Réponses IA illimitées
Classé par intention d'achat
Faut-il bloquer meta-externalagent si vous voulez de la visibilité IA ?
Bloquer meta-externalagent retire vos pages de la collecte d'entraînement IA de Meta, et cela ne vous retire pas des réponses de Meta AI, parce que Meta confie la citation et le lien à un autre crawler. Meta écrit qu'autoriser Meta-WebIndexer "nous aide à citer votre contenu et à créer des liens vers lui dans les réponses de Meta AI", donc un site qui veut des citations sans fournir de données d'entraînement interdit meta-externalagent et autorise meta-webindexer.
Ce partage est une décision, et la façon de la contrôler est la mesure, pas la supposition. Le suivi de marque LLM pour la recherche IA de RedReplier repère où ChatGPT, Claude et Gemini citent votre marque dans leurs réponses, pour que vous observiez ce qu'un changement de robots.txt fait aux citations au lieu de le deviner.
Questions fréquentes
meta-externalagent et facebookexternalhit, est-ce la même chose ?
Non. Meta les documente comme des crawlers distincts, avec des tokens robots.txt distincts et des tâches distinctes. Meta-ExternalAgent parcourt le web pour entraîner des modèles IA de fondation et indexer du contenu, tandis que FacebookExternalHit récupère un lien que quelqu'un a partagé sur Facebook, Instagram ou Messenger afin d'en construire le titre, la description et la vignette. En interdire un n'a aucun effet sur l'autre.
Bloquer meta-externalagent casse-t-il les aperçus de liens Facebook ?
Non. Les aperçus de liens sont produits par FacebookExternalHit, qui lit le token facebookexternalhit dans robots.txt. Un groupe qui interdit uniquement meta-externalagent laisse l'exploration des aperçus intacte. Si vous tenez à garder les aperçus, n'ajoutez pas facebookexternalhit à votre liste d'interdictions.
Combien de temps un changement de robots.txt met-il à atteindre les crawlers de Meta ?
La documentation de Meta vous demande de prévoir jusqu'à 24 heures, parce que ses crawlers gardent le contenu de robots.txt en cache pendant cette durée. Un blocage ajouté ce matin peut encore recevoir des visites de crawler cet après-midi sans que rien soit cassé. Si les requêtes continuent au-delà de 24 heures, vérifiez que le fichier est bien servi à la racine du domaine et renvoie 200.
Puis-je bloquer meta-externalagent avec une balise meta robots à la place ?
Meta indique préférer les pratiques standards du secteur comme robots.txt aux formats non standards comme les balises NoAI, et le seul contrôle de crawler que sa documentation décrit est robots.txt. Une balise au niveau de la page exige de plus que le crawler récupère et analyse la page d'abord, ce qui annule l'intérêt si votre but est d'empêcher la récupération. Utilisez le groupe robots.txt.
Quelle est la différence entre meta-externalagent et meta-externalfetcher ?
Meta-ExternalAgent explore largement au rythme de Meta pour constituer des données d'entraînement et d'indexation. Meta-ExternalFetcher récupère des liens individuels à la demande d'un utilisateur pour alimenter les fonctions d'IA agentique, et Meta indique que ce crawler peut contourner les règles robots.txt pour cette raison. Une interdiction dans robots.txt est donc une instruction fiable pour le premier et peu fiable pour le second.
Où Meta publie-t-il la documentation officielle de meta-externalagent ?
Meta la publie sur developers.facebook.com, sous Sharing, Webmasters, Meta Web Crawlers, à l'adresse https://developers.facebook.com/documentation/sharing/webmasters/web-crawlers. Cette page liste tous les crawlers Meta documentés, les chaînes user agent, l'exemple robots.txt et l'adresse de contact webmasters@meta.com. Consultez-la avant d'écrire des règles de pare-feu, puisque Meta révise la liste des crawlers et les suffixes de version.
La documentation de Meta sur meta-externalagent est-elle à jour ?
Meta a mis à jour sa page Meta Web Crawlers le 21 mai 2026, et les informations de cet article ont été vérifiées sur cette page le 9 septembre 2026. Les noms des crawlers et les suffixes de version changent avec le temps, donc une règle construite à partir d'une ancienne copie de la page peut manquer un nouveau jeton. Vérifiez la page en direct sur developers.facebook.com avant d'écrire une règle de pare-feu.
Qui contacter si meta-externalagent se comporte mal sur votre site ?
Meta indique un seul contact pour sa documentation des crawlers, webmasters@meta.com. Cette même page ne publie ni liste d'IP, ni ASN, ni méthode de vérification, donc un signalement à cette adresse reste votre seul canal en dehors du blocage dans robots.txt lui-même. Utilisez cette adresse pour un comportement que vos propres règles serveur ne suffisent pas à contrôler.
Meta-externalfetcher est-il le même type de crawler que ChatGPT-User ?
Meta-ExternalFetcher se déclenche quand quelqu'un demande à Meta AI de consulter un lien précis, exactement le rôle que ChatGPT-User d'OpenAI joue pour ChatGPT. Les deux répondent à une requête ponctuelle d'un utilisateur plutôt que de parcourir le web selon un calendrier, ce qui les distingue des crawlers massifs comme meta-externalagent. Meta précise que meta-externalfetcher peut contourner robots.txt, donc bloquer meta-externalagent ne change rien pour lui.
Puis-je autoriser meta-externalagent sur une partie de mon site plutôt que de le bloquer entièrement ?
La documentation de Meta montre elle-même un groupe qui autorise tout le site et exclut un répertoire, avec Allow: / suivi de Disallow: /private/. Vous pouvez appliquer le même schéma à n'importe quel dossier que vous voulez garder hors de l'entraînement tout en laissant le reste ouvert. C'est le même groupe robots.txt, avec simplement des lignes Allow et Disallow différentes au lieu d'un Disallow: / général.
Nous voir plus souvent sur Google
Un clic définit RedReplier comme source préférée. Nos articles remontent alors dans vos À la une, en mode IA et dans les aperçus IA.
Avant de partir...
RedReplier
Repérez chaque acheteur qui cherche ce que vous vendez
RedReplier surveille Reddit, X, Bluesky et Hacker News en temps réel, classe chaque sujet selon l'intention d'achat et rédige votre réponse, pour que vous arriviez en premier.
Reddit, X, Bluesky et HN
Alertes d'intention en temps réel
Réponses IA illimitées
Classé par intention d'achat
Articles connexes


Ce que CCBot collecte pour l'archive web ouverte de Common Crawl
CCBot, le robot de Common Crawl, construit une archive ouverte que des laboratoires d'IA filtrent pour l'entraînement, et une règle robots.txt contrôle tout.


En quoi ChatGPT-User diffère de GPTBot et OAI-SearchBot
L'agent ChatGPT-User d'OpenAI récupère une page seulement si quelqu'un demande à ChatGPT d'ouvrir un lien, différent de la règle pour GPTBot ou OAI-SearchBot.


Comment Cloudflare Pay Per Crawl facture les bots IA par page
Cloudflare Pay Per Crawl renvoie une réponse HTTP 402 tant qu'un robot d'IA ne paie pas le prix exact par requête que le propriétaire du site a lui-même fixé.

