TL;DR
8 lectura mínimaMeta-ExternalAgent es el rastreador que Meta usa para recopilar páginas web con las que entrenar modelos fundacionales de IA e indexar contenido directamente, y se identifica en los registros del servidor con el token meta-externalagent, según la propia documentación de rastreadores web de Meta. Un grupo User-agent de dos líneas en robots.txt lo bloquea en todo un sitio, y Meta cachea robots.txt hasta 24 horas antes de que el cambio surta efecto. Meta no publica ninguna lista de IP ni método de verificación para este rastreador, así que robots.txt detiene a los rastreadores que deciden obedecerlo y nada más.
¿Qué es meta-externalagent?
Meta opera meta-externalagent como el rastreador que recopila páginas web públicas para entrenar modelos fundacionales de IA, según la documentación Meta Web Crawlers de Meta, actualizada el 21 May 2026 y consultada el 9 September 2026. La redacción exacta de Meta es que el rastreador "rastrea la web para casos de uso como entrenar modelos fundacionales de IA o mejorar productos indexando contenido directamente". Un solo grupo de robots.txt lo controla en todo un sitio, y Meta afirma que los cambios en robots.txt tardan hasta 24 horas en surtir efecto porque sus rastreadores cachean el archivo durante ese tiempo.
¿Cuál es la cadena de user agent exacta de meta-externalagent?
Meta documenta dos formas de la cadena, y ambas empiezan por el mismo token en minúsculas:
meta-externalagent/1.1 (+/documentation/sharing/webmasters/web-crawlers)
meta-externalagent/1.1
Meta presenta las dos con la frase "La cadena UA concreta que verá en sus archivos de registro será similar a una de las siguientes", así que el sufijo de versión y la ruta entre paréntesis no son un contrato estable. Haga coincidir sus filtros de registro y sus reglas de firewall con la subcadena meta-externalagent, sin distinguir mayúsculas de minúsculas, y seguirán funcionando cuando Meta pase de 1.1 a 1.2.
¿En qué se diferencia meta-externalagent de los otros rastreadores de Meta?
Meta ejecuta cinco rastreadores documentados, y cada uno tiene un token de robots.txt propio, así que bloquear uno deja intactos los otros cuatro. Dos de ellos le avisan sin rodeos de que pueden ignorar su archivo.
| Rastreador | Token de robots.txt | Qué dice Meta que hace | Obedece robots.txt |
|---|---|---|---|
| Meta-ExternalAgent | meta-externalagent | Entrena modelos fundacionales de IA, indexa contenido directamente | Sí |
| Meta-WebIndexer | meta-webindexer | Mejora la calidad de los resultados de búsqueda de Meta AI, y permitirlo "nos ayuda a citar y enlazar su contenido en las respuestas de Meta AI" | Sí |
| Meta-ExternalAds | meta-externalads | Mejora la publicidad y otros productos relacionados con el negocio | Sí |
| Meta-ExternalFetcher | meta-externalfetcher | Descarga enlaces sueltos a petición de un usuario, da soporte a la IA agéntica | Meta afirma que "puede saltarse las reglas de robots.txt" |
| FacebookExternalHit | facebookexternalhit | Rastrea enlaces compartidos para construir el título, la descripción y la miniatura de la vista previa | Meta afirma que "podría saltarse robots.txt al realizar comprobaciones de seguridad o integridad" |
La pareja que conviene entender es meta-externalagent frente a meta-externalfetcher. El primero es un rastreador masivo que recorre la web según el calendario de Meta para construir datos de entrenamiento. El segundo se dispara cuando una persona pide a Meta AI que mire un enlace concreto, lo que lo sitúa en la misma categoría que el fetcher activado por el usuario de OpenAI, ChatGPT-User, y Meta dice que ese puede saltarse sus reglas. FacebookExternalHit queda aparte de los dos: bloquéelo y los enlaces a su sitio pierden la tarjeta de vista previa en Facebook, Instagram y Messenger.

¿Cómo se bloquea meta-externalagent en robots.txt?
Añada un grupo User-agent que nombre el token y desautorice todo el sitio. Ponga esto en la raíz de su dominio, en el archivo servido en /robots.txt:
User-agent: meta-externalagent
Disallow: /
La propia documentación de Meta muestra el mismo grupo usado al revés, permitiendo todo y apartando un directorio:
User-agent: meta-externalagent
Allow: / # Allow everything
Disallow: /private/ # Disallow a specific directory
Si su objetivo es mantener sus páginas fuera del entrenamiento de IA de varios proveedores, este grupo es una línea dentro de un archivo más largo que también nombra el token de exclusión de entrenamiento de Apple, Applebot-Extended y el CCBot de Common Crawl. La coincidencia de rutas, los comodines y la precedencia entre grupos están cubiertos en la guía completa de la sintaxis de robots.txt, así que mantenga aquí los grupos de rastreadores y allí la mecánica de las reglas.
¿Bloquear meta-externalagent detiene de verdad a Meta?
El bloqueo funciona solo porque el rastreador decide leer su archivo y obedecerlo. Robots.txt es una convención, no un control de acceso: su servidor sigue devolviendo 200 a quien lo pida, y el estándar no tiene aplicación forzosa, ni autenticación, ni sanción. Meta demuestra el límite en su propia documentación al nombrar dos rastreadores, meta-externalfetcher y facebookexternalhit, que pueden descargar páginas que su archivo desautoriza.
La aplicación real vive en el servidor. Una regla de denegación sobre la cadena de user agent, un bloqueo de IP, una regla de WAF o una puerta de acceso de pago como el pay per crawl de Cloudflare devuelve 403 en lugar de contenido, y esa decisión es suya, no del rastreador.

¿Se puede verificar que una petición de meta-externalagent viene realmente de Meta?
La documentación de rastreadores de Meta no ofrece ninguna forma de verificarlo. La página no publica rangos de IP, ni número de sistema autónomo, ni regla de DNS inverso confirmado hacia delante para meta-externalagent, lo que deja la cadena de user agent como único identificador, y cualquier cliente de internet puede enviar esa cabecera con un flag de curl. El único contacto que Meta ofrece en esa página es webmasters@meta.com.
Trate la cadena como una etiqueta, no como una prueba. Si está aplicando un bloqueo en lugar de solicitarlo, escriba la regla contra un comportamiento de petición que pueda observar, como el ritmo y el patrón de rutas desde una sola IP, y reserve la coincidencia por user agent para los rastreadores que se identifican con honestidad.
¿Importan las mayúsculas al bloquear meta-externalagent?
Las mayúsculas del nombre del rastreador no importan. El RFC 9309 exige que los rastreadores comparen el token de producto de una línea User-agent sin distinguir mayúsculas de minúsculas, así que meta-externalagent, Meta-ExternalAgent y META-EXTERNALAGENT seleccionan el mismo grupo. La escritura sí importa: un guion que falta o un carácter suelto produce un token que no coincide con ningún rastreador, y el bloqueo falla sin ningún error que se lo indique. Las rutas son el caso contrario. El RFC 9309 indica que las rutas de Disallow y Allow deben compararse distinguiendo mayúsculas de minúsculas, así que /Private/ y /private/ son dos reglas distintas.
RedReplier
Comenzar
Reddit, X, Bluesky y HN
Alertas de intención en tiempo real
Respuestas IA ilimitadas
Ordenado por intención de compra
¿Debería bloquear meta-externalagent si quiere visibilidad en IA?
Bloquear meta-externalagent retira sus páginas de la recopilación de entrenamiento de IA de Meta, y no lo retira de las respuestas de Meta AI, porque Meta asigna la cita y el enlace a un rastreador distinto. Meta escribe que permitir Meta-WebIndexer "nos ayuda a citar y enlazar su contenido en las respuestas de Meta AI", así que un sitio que quiere citas sin aportar datos de entrenamiento desautoriza meta-externalagent y permite meta-webindexer.
Esa división es una decisión, y la forma de comprobarla es medir, no suponer. La monitorización de marca en LLM para la búsqueda con IA de RedReplier registra dónde citan su marca ChatGPT, Claude y Gemini en sus respuestas, de modo que puede observar qué hace un cambio en robots.txt con las citas en lugar de adivinarlo.
Preguntas frecuentes
¿Es meta-externalagent lo mismo que facebookexternalhit?
No. Meta los documenta como rastreadores distintos con tokens de robots.txt distintos y trabajos distintos. Meta-ExternalAgent rastrea la web para entrenar modelos fundacionales de IA e indexar contenido, mientras que FacebookExternalHit descarga un enlace que alguien compartió en Facebook, Instagram o Messenger para construir su título, su descripción y su miniatura. Desautorizar uno no tiene efecto sobre el otro.
¿Bloquear meta-externalagent rompe las vistas previas de enlaces en Facebook?
No. Las vistas previas de enlaces las produce FacebookExternalHit, que lee el token facebookexternalhit en robots.txt. Un grupo que desautoriza solo meta-externalagent deja intacto el rastreo de vistas previas. Si quiere conservar las vistas previas, no añada facebookexternalhit a su lista de disallow.
¿Cuánto tarda un cambio en robots.txt en llegar a los rastreadores de Meta?
La documentación de Meta le pide que deje pasar hasta 24 horas, porque sus rastreadores cachean el contenido de robots.txt hasta ese tiempo. Un bloqueo añadido esta mañana puede seguir viendo visitas del rastreador esta tarde sin que nada esté roto. Si las peticiones continúan pasadas 24 horas, compruebe que el archivo se sirve en la raíz del dominio y devuelve 200.
¿Puedo bloquear meta-externalagent con una metaetiqueta robots en su lugar?
Meta afirma que prefiere prácticas estándar del sector como robots.txt frente a formatos no estándar como las etiquetas NoAI, y el único control de rastreadores que describe su documentación es robots.txt. Una metaetiqueta a nivel de página exige además que el rastreador descargue y analice la página primero, lo que anula el propósito si su objetivo es evitar la descarga. Use el grupo de robots.txt.
¿Cuál es la diferencia entre meta-externalagent y meta-externalfetcher?
Meta-ExternalAgent rastrea de forma amplia según el calendario propio de Meta para construir datos de entrenamiento e indexación. Meta-ExternalFetcher descarga enlaces sueltos a petición de un usuario para dar soporte a funciones de IA agéntica, y Meta afirma que ese rastreador puede saltarse las reglas de robots.txt por esa razón. Un disallow en robots.txt es, por tanto, una instrucción fiable para el primero y poco fiable para el segundo.
¿Dónde publica Meta la documentación oficial de meta-externalagent?
Meta la publica en developers.facebook.com bajo Sharing, Webmasters, Meta Web Crawlers, en https://developers.facebook.com/documentation/sharing/webmasters/web-crawlers. Esa página enumera cada rastreador documentado de Meta, las cadenas de user agent, el ejemplo de robots.txt y la dirección de contacto webmasters@meta.com. Consúltela antes de escribir reglas de firewall, ya que Meta revisa la lista de rastreadores y los sufijos de versión.
¿Qué tan actualizada está la documentación de Meta sobre meta-externalagent?
Meta actualizó su página Meta Web Crawlers el 21 de mayo de 2026, y los datos de este artículo se verificaron contra esa página el 9 de septiembre de 2026. Los nombres de los rastreadores y los sufijos de versión cambian con el tiempo, así que una regla basada en una copia antigua de la página puede pasar por alto un token nuevo. Revise la página en vivo en developers.facebook.com antes de escribir una regla de firewall.
¿A quién se contacta si meta-externalagent se comporta mal en su sitio?
Meta indica un único contacto para su documentación de rastreadores, webmasters@meta.com. Esa misma página no publica lista de IPs, ni ASN, ni un método de verificación, así que un aviso a esa dirección es su único canal además del propio bloqueo en robots.txt. Use esa dirección para el comportamiento que no puede controlar con sus propias reglas de servidor.
¿Meta-externalfetcher es el mismo tipo de rastreador que ChatGPT-User?
Meta-ExternalFetcher entra en acción cuando alguien le pide a Meta AI que revise un enlace concreto, el mismo trabajo que ChatGPT-User de OpenAI hace para ChatGPT. Ambos responden a una petición puntual de un usuario en lugar de rastrear ampliamente según un calendario, lo que los distingue de rastreadores masivos como meta-externalagent. Meta indica que meta-externalfetcher puede saltarse robots.txt, así que bloquear meta-externalagent no le afecta en nada.
¿Puedo permitir meta-externalagent en parte de mi sitio en lugar de bloquearlo por completo?
La propia documentación de Meta muestra un grupo que permite todo el sitio y excluye un directorio, con Allow: / seguido de Disallow: /private/. Puede aplicar el mismo patrón a cualquier carpeta que quiera mantener fuera del entrenamiento mientras deja el resto abierto. Es el mismo grupo de robots.txt, solo con líneas Allow y Disallow distintas en lugar de un Disallow: / general.
Vernos más en Google
Un clic marca RedReplier como fuente preferida y nuestros artículos aparecen más arriba en tus Noticias destacadas, el modo IA y los resúmenes con IA.
Antes de irte...
RedReplier
Detecta a cada comprador que busca lo que vendes
RedReplier vigila Reddit, X, Bluesky y Hacker News en tiempo real, clasifica cada hilo por intención de compra y redacta tu respuesta, para que llegues primero.
Reddit, X, Bluesky y HN
Alertas de intención en tiempo real
Respuestas IA ilimitadas
Ordenado por intención de compra
Artículos relacionados


Qué recopila CCBot para el archivo web abierto de Common Crawl
CCBot, rastreador de Common Crawl, arma un archivo abierto que laboratorios de IA filtran para entrenar modelos, y una regla en robots.txt lo controla todo.


En qué se diferencia ChatGPT-User de GPTBot y OAI-SearchBot
El agente ChatGPT-User de OpenAI recupera una página solo si alguien le pide a ChatGPT abrir un enlace, distinto de la regla para GPTBot u OAI-SearchBot.


Cómo Cloudflare Pay Per Crawl cobra a los bots de IA por página
Cloudflare Pay Per Crawl devuelve una respuesta HTTP 402 hasta que un rastreador de IA paga el precio por solicitud que fijó el propietario del sitio.

