glossary

Metas KI-Trainings-Crawler meta-externalagent, und wie Sie ihn sperren

Taras Shynkarenko
Taras Shynkarenko
Updated: 7 Min. gelesen
Metas KI-Trainings-Crawler meta-externalagent, und wie Sie ihn sperrenMetas KI-Trainings-Crawler meta-externalagent, und wie Sie ihn sperren

TL;DR

7 Min. gelesen

Meta-ExternalAgent ist der Crawler, mit dem Meta Webseiten für das Training von KI-Foundation-Models und für die direkte Indexierung von Inhalten sammelt, und laut Metas eigener Web-Crawler-Dokumentation weist er sich in Server-Logs mit dem Token meta-externalagent aus. Eine zweizeilige User-agent-Gruppe in robots.txt sperrt ihn für eine ganze Website, und Meta cacht robots.txt bis zu 24 Stunden, bevor die Änderung wirkt. Meta veröffentlicht für diesen Crawler weder eine IP-Liste noch eine Verifizierungsmethode, robots.txt stoppt also die Crawler, die sich freiwillig daran halten, und sonst nichts.

Was ist meta-externalagent?

Meta betreibt meta-externalagent als den Crawler, der öffentliche Webseiten für das Training von KI-Foundation-Models sammelt, laut Metas Dokumentation Meta Web Crawlers, aktualisiert am 21 May 2026 und geprüft am 9 September 2026. Metas exakte Formulierung lautet, dass der Crawler "das Web für Anwendungsfälle wie das Training von KI-Foundation-Models oder die Verbesserung von Produkten durch direkte Indexierung von Inhalten durchsucht." Eine einzige robots.txt-Gruppe steuert ihn für eine gesamte Website, und Meta gibt an, dass Änderungen an robots.txt bis zu 24 Stunden brauchen, bis sie wirken, weil seine Crawler die Datei so lange cachen.

Wie lautet der exakte User-Agent-String von meta-externalagent?

Meta dokumentiert zwei Formen des Strings, und beide beginnen mit demselben kleingeschriebenen Token:

meta-externalagent/1.1 (+/documentation/sharing/webmasters/web-crawlers)
meta-externalagent/1.1

Meta leitet beide mit dem Satz ein, dass "der konkrete UA-String, den Sie in Ihren Logdateien sehen werden, einem der folgenden ähnelt", das Versionssuffix und der eingeklammerte Pfad sind also keine stabile Zusage. Gleichen Sie Ihre Log-Filter und Firewall-Regeln auf den Teilstring meta-externalagent ab, ohne Beachtung der Groß- und Kleinschreibung, dann funktionieren sie weiter, wenn Meta 1.1 auf 1.2 hebt.

Wie unterscheidet sich meta-externalagent von Metas anderen Crawlern?

Meta betreibt fünf dokumentierte Crawler, und jeder hat ein eigenes robots.txt-Token, eine Sperre für einen lässt die anderen vier also unberührt. Zwei davon sagen Ihnen offen, dass sie Ihre Datei ignorieren können.

Crawlerrobots.txt-TokenWas Meta über ihn sagtBefolgt robots.txt
Meta-ExternalAgentmeta-externalagentTrainiert KI-Foundation-Models, indexiert Inhalte direktJa
Meta-WebIndexermeta-webindexerVerbessert die Qualität der Meta-AI-Suchergebnisse, und ihn zuzulassen "hilft uns, Ihre Inhalte in den Antworten von Meta AI zu zitieren und zu verlinken"Ja
Meta-ExternalAdsmeta-externaladsVerbessert Werbung und andere geschäftsbezogene ProdukteJa
Meta-ExternalFetchermeta-externalfetcherRuft einzelne Links auf Wunsch eines Nutzers ab, unterstützt agentische KIMeta gibt an, er "kann robots.txt-Regeln umgehen"
FacebookExternalHitfacebookexternalhitCrawlt geteilte Links, um Titel, Beschreibung und Thumbnail-Vorschau aufzubauenMeta gibt an, er "umgeht robots.txt möglicherweise bei Sicherheits- oder Integritätsprüfungen"

Das Paar, das man verstehen sollte, ist meta-externalagent gegenüber meta-externalfetcher. Der erste ist ein Massen-Crawler, der das Web nach Metas Zeitplan abläuft, um Trainingsdaten aufzubauen. Der zweite startet, wenn eine Person Meta AI bittet, sich einen bestimmten Link anzusehen, was ihn in dieselbe Kategorie stellt wie OpenAIs nutzergesteuerten Abrufagenten ChatGPT-User, und Meta sagt, dass dieser Ihre Regeln umgehen kann. FacebookExternalHit steht abseits von beiden: Sperren Sie ihn, und Links auf Ihre Website verlieren ihre Vorschaukarte auf Facebook, Instagram und Messenger.

Ein Serverrack in einem Rechenzentrum, das die Infrastruktur zeigt, in der eine robots.txt-Datei im Domain-Root liegt.

Wie sperren Sie meta-externalagent in robots.txt?

Fügen Sie eine User-agent-Gruppe hinzu, die das Token nennt, und sperren Sie die gesamte Website. Legen Sie das im Stammverzeichnis Ihrer Domain ab, in der Datei, die unter /robots.txt ausgeliefert wird:

User-agent: meta-externalagent
Disallow: /

Metas eigene Dokumentation zeigt dieselbe Gruppe andersherum: alles erlauben und ein Verzeichnis ausnehmen:

User-agent: meta-externalagent
Allow: /                    # Allow everything
Disallow: /private/         # Disallow a specific directory

Wenn Ihr Ziel ist, Ihre Seiten anbieterübergreifend aus dem KI-Training herauszuhalten, ist diese Gruppe eine Zeile in einer längeren Datei, die auch Apples Trainings-Opt-out-Token Applebot-Extended und Common Crawls CCBot nennt. Pfadabgleich, Wildcards und Gruppenpriorität behandelt der vollständige Leitfaden zur robots.txt-Syntax, halten Sie also die Crawler-Gruppen hier und die Regelmechanik dort.

Stoppt eine Sperre von meta-externalagent Meta tatsächlich?

Die Sperre wirkt nur, weil der Crawler sich entscheidet, Ihre Datei zu lesen und zu befolgen. Robots.txt ist eine Konvention, keine Zugriffskontrolle: Ihr Server liefert weiterhin 200 an jeden, der fragt, und der Standard kennt keine Durchsetzung, keine Authentifizierung und keine Sanktion. Meta führt die Grenze in seiner eigenen Dokumentation vor, indem es zwei Crawler benennt, meta-externalfetcher und facebookexternalhit, die Seiten abrufen können, die Ihre Datei sperrt.

Durchgesetzt wird am Server. Eine Deny-Regel auf den User-Agent-String, eine IP-Sperre, eine WAF-Regel oder ein kostenpflichtiges Zugangstor wie Cloudflares Pay per Crawl liefert 403 statt Inhalt, und diese Entscheidung liegt bei Ihnen, nicht beim Crawler.

Eine Lupe über einem Laptop-Bildschirm, die den Versuch symbolisiert, zu prüfen, wer wirklich hinter einer Crawler-Anfrage steckt.

Vom Hinweis zur Durchsetzung
1
Robots.txt-Sperre. Funktioniert nur, wenn der Crawler die Datei liest und sich daran hält.
2
Deny-Regel für den User-Agent-String. Der Server weist jede Anfrage ab, die sich als meta-externalagent zu erkennen gibt.
3
IP-Sperre. Der Server blockiert Anfragen aus Bereichen, die Sie selbst identifiziert haben.
4
WAF-Regel. Eine Web Application Firewall filtert nach dem Anfragemuster statt nach der Angabe des Crawlers.
5
Bezahlschranke. Ein System wie Cloudflares Pay per Crawl liefert 403, bis die Zahlung erfolgt ist.
Robots.txt funktioniert nur, wenn der Crawler zustimmt; alles danach ist der Server, der selbst Nein sagt.

Können Sie prüfen, ob eine Anfrage von meta-externalagent wirklich von Meta kommt?

Metas Crawler-Dokumentation nennt keinen Weg zur Überprüfung. Die Seite veröffentlicht keine IP-Bereiche, keine Autonomous System Number und keine Forward-Confirmed-Reverse-DNS-Regel für meta-externalagent, womit der User-Agent-String der einzige Identifikator bleibt, und jeder Client im Internet kann diesen Header mit einem einzigen curl-Flag senden. Der einzige Kontakt, den Meta auf dieser Seite anbietet, ist webmasters@meta.com.

Behandeln Sie den String als Etikett, nicht als Beweis. Wenn Sie eine Sperre durchsetzen statt sie zu erbitten, schreiben Sie die Regel gegen beobachtbares Anfrageverhalten, etwa Rate und Pfadmuster einer einzelnen IP, und behalten Sie den User-Agent-Abgleich den Crawlern vor, die sich ehrlich ausweisen.

Spielt die Groß- und Kleinschreibung beim Sperren von meta-externalagent eine Rolle?

Die Groß- und Kleinschreibung des Crawler-Namens spielt keine Rolle. RFC 9309 verlangt von Crawlern, das Produkt-Token in einer User-agent-Zeile ohne Beachtung der Groß- und Kleinschreibung abzugleichen, deshalb wählen meta-externalagent, Meta-ExternalAgent und META-EXTERNALAGENT dieselbe Gruppe aus. Die Schreibweise spielt sehr wohl eine Rolle: Ein fehlender Bindestrich oder ein verirrtes Zeichen ergibt ein Token, das zu keinem Crawler passt, und die Sperre scheitert ohne jede Fehlermeldung. Bei Pfadwerten ist es umgekehrt. RFC 9309 legt fest, dass Disallow- und Allow-Pfade unter Beachtung der Groß- und Kleinschreibung abgeglichen werden sollen, /Private/ und /private/ sind also zwei verschiedene Regeln.

RedReplier
RedReplier

Loslegen

Reddit, X, Bluesky & HN

Echtzeit-Kaufabsicht-Alerts

Unbegrenzte KI-Antworten

Nach Kaufabsicht sortiert

Sollten Sie meta-externalagent sperren, wenn Sie KI-Sichtbarkeit wollen?

Eine Sperre von meta-externalagent nimmt Ihre Seiten aus Metas Trainingsdatensammlung heraus, und sie nimmt Sie nicht aus den Antworten von Meta AI heraus, weil Meta Zitat und Verlinkung einem anderen Crawler zuweist. Meta schreibt, dass es "uns hilft, Ihre Inhalte in den Antworten von Meta AI zu zitieren und zu verlinken", wenn Meta-WebIndexer zugelassen ist, eine Website, die Zitate will, ohne Trainingsdaten beizusteuern, sperrt also meta-externalagent und erlaubt meta-webindexer.

Diese Aufteilung ist eine Entscheidung, und der Weg, sie zu prüfen, ist Messung statt Annahme. RedReplier bietet LLM-Brand-Monitoring für die KI-Suche und verfolgt, wo ChatGPT, Claude und Gemini Ihre Marke in ihren Antworten zitieren, damit Sie beobachten können, was eine robots.txt-Änderung mit den Zitaten macht, statt zu raten.

Häufig gestellte Fragen

Ist meta-externalagent dasselbe wie facebookexternalhit?

Nein. Meta dokumentiert sie als getrennte Crawler mit getrennten robots.txt-Tokens und getrennten Aufgaben. Meta-ExternalAgent crawlt das Web, um KI-Foundation-Models zu trainieren und Inhalte zu indexieren, während FacebookExternalHit einen Link abruft, den jemand auf Facebook, Instagram oder Messenger geteilt hat, um daraus Titel, Beschreibung und Thumbnail zu bauen. Eine Sperre für den einen hat keine Wirkung auf den anderen.

Zerstört eine Sperre von meta-externalagent die Facebook-Linkvorschauen?

Nein. Linkvorschauen erzeugt FacebookExternalHit, der das Token facebookexternalhit in robots.txt liest. Eine Gruppe, die nur meta-externalagent sperrt, lässt das Vorschau-Crawling unberührt. Wenn Sie die Vorschauen behalten wollen, nehmen Sie facebookexternalhit nicht in Ihre Disallow-Liste auf.

Wie lange braucht eine robots.txt-Änderung, bis sie Metas Crawler erreicht?

Metas Dokumentation bittet Sie, bis zu 24 Stunden einzuplanen, weil seine Crawler den Inhalt von robots.txt so lange cachen. Eine heute Morgen ergänzte Sperre kann heute Nachmittag noch Crawler-Zugriffe sehen, ohne dass etwas kaputt ist. Wenn die Anfragen über 24 Stunden hinaus weitergehen, prüfen Sie, ob die Datei im Domain-Stammverzeichnis ausgeliefert wird und 200 zurückgibt.

Kann ich meta-externalagent stattdessen mit einem Meta-Robots-Tag sperren?

Meta gibt an, Branchenstandards wie robots.txt gegenüber nicht standardisierten Formaten wie NoAI-Tags zu bevorzugen, und die einzige Crawler-Steuerung, die seine Dokumentation beschreibt, ist robots.txt. Ein Meta-Tag auf Seitenebene verlangt außerdem, dass der Crawler die Seite erst abruft und parst, was den Zweck zunichtemacht, wenn Sie den Abruf verhindern wollen. Nehmen Sie die robots.txt-Gruppe.

Was ist der Unterschied zwischen meta-externalagent und meta-externalfetcher?

Meta-ExternalAgent crawlt breit nach Metas eigenem Zeitplan, um Trainings- und Indexierungsdaten aufzubauen. Meta-ExternalFetcher ruft einzelne Links auf Wunsch eines Nutzers ab, um agentische KI-Funktionen zu unterstützen, und Meta gibt an, dass dieser Crawler aus diesem Grund robots.txt-Regeln umgehen kann. Ein robots.txt-Disallow ist damit eine verlässliche Anweisung an den ersten und eine unzuverlässige an den zweiten.

Wo veröffentlicht Meta die offizielle meta-externalagent-Dokumentation?

Meta veröffentlicht sie auf developers.facebook.com unter Sharing, Webmasters, Meta Web Crawlers, unter https://developers.facebook.com/documentation/sharing/webmasters/web-crawlers. Diese Seite listet jeden dokumentierten Meta-Crawler, die User-Agent-Strings, das robots.txt-Beispiel und die Kontaktadresse webmasters@meta.com. Sehen Sie dort nach, bevor Sie Firewall-Regeln schreiben, denn Meta überarbeitet die Crawler-Liste und die Versionssuffixe.

Wie aktuell ist Metas Dokumentation zu meta-externalagent?

Meta hat seine Seite Meta Web Crawlers am 21. Mai 2026 aktualisiert, und die Angaben in diesem Artikel wurden am 9. September 2026 gegen diese Seite geprüft. Crawler-Namen und Versionsnummern ändern sich mit der Zeit, sodass eine Regel aus einer alten Kopie der Seite ein neues Token übersehen kann. Prüfen Sie die aktuelle Seite unter developers.facebook.com, bevor Sie eine Firewall-Regel schreiben.

An wen wenden Sie sich, wenn meta-externalagent sich auf Ihrer Seite falsch verhält?

Meta nennt für seine Crawler-Dokumentation einen einzigen Kontakt, webmasters@meta.com. Dieselbe Seite veröffentlicht keine IP-Liste, keine ASN und keine Verifizierungsmethode, sodass eine Meldung an diese Adresse neben der robots.txt-Sperre selbst Ihr einziger Kanal ist. Nutzen Sie sie für Verhalten, das Sie mit eigenen Serverregeln nicht in den Griff bekommen.

Ist meta-externalfetcher dieselbe Art von Crawler wie ChatGPT-User?

Meta-ExternalFetcher wird aktiv, wenn jemand Meta AI bittet, einen bestimmten Link anzusehen, dieselbe Aufgabe, die OpenAIs ChatGPT-User für ChatGPT übernimmt. Beide reagieren auf eine einzelne Nutzeranfrage statt planmäßig breit zu crawlen, was sie von Bulk-Crawlern wie meta-externalagent unterscheidet. Meta gibt an, dass meta-externalfetcher robots.txt umgehen kann, sodass eine Sperre von meta-externalagent daran nichts ändert.

Kann ich meta-externalagent für einen Teil der Website erlauben, statt sie komplett zu sperren?

Metas eigene Dokumentation zeigt eine Gruppe, die die ganze Website erlaubt und ein Verzeichnis ausschließt, mit Allow: / gefolgt von Disallow: /private/. Dasselbe Muster können Sie auf jeden Ordner anwenden, den Sie vom Training ausschließen wollen, während der Rest offen bleibt. Es ist dieselbe robots.txt-Gruppe, nur mit anderen Allow- und Disallow-Zeilen statt einem pauschalen Disallow: /.

Sieh uns öfter bei Google

Ein Klick macht RedReplier zu einer bevorzugten Quelle. Unsere Artikel stehen dann weiter oben in deinen Top-Meldungen, im KI-Modus und in den KI-Übersichten.

Bevor du gehst...

RedReplier

RedReplier

Erreichen Sie jeden Käufer, der nach Ihrem Angebot sucht

RedReplier überwacht Reddit, X, Bluesky und Hacker News in Echtzeit, bewertet jeden Thread nach Kaufabsicht und entwirft Ihre Antwort, damit Sie als Erster da sind.

Reddit, X, Bluesky & HN

Echtzeit-Kaufabsicht-Alerts

Unbegrenzte KI-Antworten

Nach Kaufabsicht sortiert

Verwandte Artikel