glossary

Das Sperren von OAI-SearchBot vs GPTBot kostet Sie zwei verschiedene Dinge

Taras Shynkarenko
Taras Shynkarenko
Updated: 8 Min. gelesen
Das Sperren von OAI-SearchBot vs GPTBot kostet Sie zwei verschiedene DingeDas Sperren von OAI-SearchBot vs GPTBot kostet Sie zwei verschiedene Dinge

TL;DR

8 Min. gelesen

OpenAI dokumentiert drei Web-Agenten mit drei Aufgaben: GPTBot crawlt für das Training generativer KI-Foundation-Models, OAI-SearchBot crawlt, um Websites in der Suchfunktion von ChatGPT zu zeigen, und ChatGPT-User ruft eine einzelne Seite ab, die eine Person ChatGPT zu öffnen gebeten hat. Ein Disallow für GPTBot nimmt Ihre Seiten aus dem Trainingsmaterial heraus und lässt die ChatGPT-Suche unberührt, und ein Disallow für OAI-SearchBot nimmt Sie von der Oberfläche herunter, die Menschen lesen und anklicken. Website-Betreiber, die aus dem Training heraus wollen und den Traffic behalten möchten, sollten nur GPTBot nennen.

Was ist der Unterschied zwischen OAI-SearchBot vs GPTBot?

OpenAI betreibt OAI-SearchBot vs GPTBot als zwei Crawler mit zwei unverbundenen Aufgaben: OAI-SearchBot ruft Seiten ab, damit die Suchfunktion von ChatGPT sie zeigen kann, und GPTBot ruft Seiten ab, um OpenAIs generative KI-Foundation-Models zu trainieren, laut OpenAIs eigener Bot-Dokumentation auf developers.openai.com, geprüft am 9 September 2026. Jeder liest seinen eigenen benannten Block in robots.txt, und eine Regel für den einen hat keine Wirkung auf den anderen. Diese Trennung ist der ganze Sinn des Designs: OpenAI gibt an, es "verwendet die robots.txt-Tags OAI-SearchBot und GPTBot, damit Webmaster steuern können, wie ihre Websites und Inhalte mit KI zusammenarbeiten."

Wie lauten die exakten User-Agent-Strings von OpenAIs Crawlern?

OpenAI veröffentlicht den vollständigen User-Agent-String für jeden Agenten, den es betreibt, und jeder trägt eine selbsterklärende URL, die Sie prüfen können. Kopieren Sie diese Zeichen für Zeichen, wenn Sie einen Log-Filter schreiben, denn ein Teilstring-Abgleich auf GPT allein erwischt drei verschiedene Agenten auf einmal.

AgentVollständiger User-Agent-StringVeröffentlichte IP-Bereiche
GPTBotMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbotopenai.com/gptbot.json
OAI-SearchBotMozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; +https://openai.com/searchbotopenai.com/searchbot.json
ChatGPT-UserMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/botopenai.com/chatgpt-user.json
OAI-AdsBotMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-AdsBot/1.0; +https://openai.com/adsbotopenai.com/adsbot.json

OAI-SearchBot sendet außerdem eine zweite dokumentierte Variante, die das Token robots.txt vor der URL einfügt: Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; robots.txt; +https://openai.com/searchbot. Schreiben Sie Ihren Log-Filter gegen das nackte Token OAI-SearchBot, damit beide Varianten im selben Eimer landen.

Ein Entwickler bearbeitet die robots.txt-Datei einer Website, passend zur Entscheidung, welchen OpenAI-Crawler man sperrt.

Welchen OpenAI-Bot sollten Sie tatsächlich sperren?

Sperren Sie den, dessen Ergebnis Sie nicht wollen, und die Kostenspalte unten ist der Teil, den Website-Betreiber überspringen. OpenAI knüpft jeden Agenten an eine andere Produktoberfläche, die drei Regeln kaufen also drei verschiedene Ergebnisse.

AgentWofür OpenAI ihn nutztWas eine Sperre Sie kostetrobots.txt-Anweisung
GPTBotCrawlt Inhalte für das Training generativer KI-Foundation-ModelsIhre Seiten fließen über diesen Crawl nicht mehr in künftiges Modelltraining ein. Die ChatGPT-Suche bleibt unberührt.User-agent: GPTBot dann Disallow: /
OAI-SearchBotTreibt die Suchfunktionen von ChatGPT an, um Websites in Suchergebnissen zu zeigenOpenAI gibt an, ausgestiegene Websites "werden nicht in ChatGPT-Suchantworten gezeigt, können aber weiterhin als navigatorische Links erscheinen."User-agent: OAI-SearchBot dann Disallow: /
ChatGPT-UserBearbeitet nutzerinitiierte Aktionen in ChatGPT und Custom GPTsChatGPT kann Ihre Seite nicht öffnen, wenn eine Person den Link einfügt und danach fragt. OpenAI merkt an, dass robots.txt-Regeln hier möglicherweise nicht gelten, weil die Anfrage einer aktiven Nutzeraktion folgt.User-agent: ChatGPT-User dann Disallow: /

Das vollständige Verhalten dieses dritten Agenten, samt der Frage, warum eine robots.txt-Regel bei einem nutzergesteuerten Abruf anders wirkt, behandelt die eigene Seite zu ChatGPT-User.

Warum sperren die meisten Website-Betreiber den falschen?

Der Fehler besteht darin, "die KI-Crawler sperren" als eine Entscheidung zu behandeln, obwohl OpenAI daraus zwei gebaut hat. GPTBot ist der Name, den Leute aus der Berichterstattung über KI-Trainingsdaten kennen, also landet er zusammen mit OAI-SearchBot in einer pauschalen Regel, und die pauschale Regel nimmt die Website von der Oberfläche herunter, die echte Leser schickt. Traffic aus der Suchfunktion von ChatGPT hängt davon ab, dass OAI-SearchBot die zitierte Seite lesen darf; Trainingsmaterial schickt überhaupt niemanden auf Ihre Website. Entscheiden Sie die beiden Fragen getrennt, und schreiben Sie dann zwei Blöcke.

Welche robots.txt sollten Sie je nach Absicht kopieren?

Wählen Sie die Absicht, die zu Ihrem Geschäft passt, und fügen Sie den passenden Block im Stammverzeichnis Ihrer Domain ein. Jede User-agent-Gruppe steht für sich, eine Anweisung unter einem Namen erreicht also nie einen anderen.

Aus dem Modelltraining heraus, den Traffic der ChatGPT-Suche behalten. Das ist die Einstellung, die die meisten Publisher und SaaS-Websites wollen:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

OpenAI vollständig verlassen, samt Suchoberfläche und nutzergesteuerten Abrufen:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

Alles erlauben außer den Pfaden, die weder in ein Modell noch in eine Antwort gelangen sollen:

User-agent: GPTBot
Disallow: /members/
Disallow: /checkout/
Disallow: /account/

User-agent: OAI-SearchBot
Disallow: /members/
Disallow: /checkout/
Disallow: /account/

Die Vorrangregeln, die entscheiden, welche Zeile gewinnt, wenn Allow und Disallow beide auf eine URL passen, stehen in der vollständigen robots.txt-Referenz.

Wird robots.txt durchgesetzt oder nur befolgt?

Robots.txt wird per Konvention befolgt und von nichts durchgesetzt. RFC 9309, der im September 2022 veröffentlichte Standard des Robots Exclusion Protocol, stellt in seinen Security Considerations klar fest, dass "das Robots Exclusion Protocol kein Ersatz für wirksame Maßnahmen zur Inhaltssicherheit ist", und sein Eingangsabschnitt merkt an, dass diese Regeln "keine Form der Zugriffsautorisierung" sind. Eine Disallow-Zeile ist eine Bitte, die ein gut erzogener Crawler vor dem Abruf liest und die ein schlecht erzogener ohne jede technische Folge ignorieren kann. Wenn eine Seite von niemandem außerhalb Ihrer Login-Schranke gelesen werden darf, stellen Sie sie hinter eine Authentifizierung oder eine serverseitige IP-Regel und behandeln Sie den robots.txt-Eintrag als Dokumentation Ihrer Absicht gegenüber den Crawlern, die sich daran halten.

Reihen von Serverracks in einem Rechenzentrum, sinnbildlich für die Infrastruktur, die Crawler-IP-Adressen protokolliert und prüft.

Wie prüfen Sie, ob eine Anfrage wirklich von OpenAI kam?

Gleichen Sie die Quell-IP-Adresse gegen die JSON-Dateien ab, die OpenAI veröffentlicht, denn ein User-Agent-String ist ein Header, den jeder Client eintippen kann. OpenAI listet aktuelle Bereiche unter openai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json und openai.com/adsbot.json, wobei jede Datei ein creationTime-Feld und ein Array von CIDR-Präfixen trägt. Geprüft am 9 September 2026 listete openai.com/searchbot.json 35 IPv4-Präfixe mit einem creationTime von 2026-01-02, und openai.com/gptbot.json listete 21 Präfixe mit einem creationTime von 2025-10-30. Holen Sie die Datei nach Zeitplan neu, statt die Bereiche fest zu verdrahten, und behandeln Sie jede Anfrage mit einem OpenAI-Token von einer Adresse außerhalb der aktuellen Liste als Fälschung, nicht als Crawler, der Ihre Regeln ignoriert.

RedReplier
RedReplier

Loslegen

Reddit, X, Bluesky & HN

Echtzeit-Kaufabsicht-Alerts

Unbegrenzte KI-Antworten

Nach Kaufabsicht sortiert

Wie lange braucht eine robots.txt-Änderung, bis sie OpenAI erreicht?

OpenAIs Dokumentation gibt für Suchergebnisse an, dass "es ~24 Stunden ab der robots.txt-Aktualisierung einer Website dauern kann, bis unsere Systeme sich anpassen." Diese Verzögerung gilt für die Suchoberfläche, eine Website, die OAI-SearchBot von gesperrt auf erlaubt umstellt, sollte also rund einen Tag einplanen, bis das Suchverhalten von ChatGPT das abbildet. Spielen Sie die Änderung aus, notieren Sie den Zeitstempel, und warten Sie mit einer zweiten Bearbeitung, bis ein voller Tag vergangen ist, denn zwei Änderungen innerhalb des Propagationsfensters machen das Ergebnis unlesbar.

Den richtigen Bot sperren, dann prüfen, ob es hält
1
Ziel festlegen. GPTBot füttert das Modelltraining, OAI-SearchBot füttert die ChatGPT-Suche. Wählen Sie eins, beide oder keins.
2
Für jeden Agenten einen eigenen Block schreiben. Eine Regel unter einem User-agent-Namen erreicht nie einen anderen.
3
Rund 24 Stunden warten. OpenAIs Dokumentation nennt etwa einen Tag, bis sich eine robots.txt-Änderung in der Suche zeigt.
4
Die Quell-IP prüfen, nicht nur den User-Agent. Anfragen gegen OpenAIs veröffentlichte CIDR-Bereiche abgleichen, bevor Sie einer Logzeile vertrauen.
Jeder Schritt schließt die Lücke, die der vorherige offenlässt, von der Wahl des Agenten bis zur Bestätigung, dass die Sperre wirklich greift.

Was sollten Sie verfolgen, nachdem Sie die Regeln gesetzt haben?

Verfolgen Sie, ob ChatGPT Sie tatsächlich zitiert, denn eine korrekte robots.txt ist ein Input und ein Zitat ist das Ergebnis. Brand Monitoring für die KI-Suche beobachtet, wo ChatGPT, Claude und Gemini eine Marke in ihren Antworten nennen, und das ist der einzige direkte Messwert dafür, ob Ihnen das Zulassen von OAI-SearchBot etwas gebracht hat. Dieselbe Trennung zwischen Training und Suche taucht in den Stacks anderer Anbieter auf: Applebot-Extended ist Apples Trainings-Opt-out, das Siri, Spotlight und die Safari-Suche in Ruhe lässt, und CCBot ist das offene Archiv von Common Crawl, das externe Labore in Trainingsdatensätze filtern. Überhaupt zitiert zu werden ist eine eigene Disziplin neben dem Gecrawltwerden, und die behandelt Answer Engine Optimization.

Häufig gestellte Fragen

Nimmt mich eine Sperre von GPTBot aus der ChatGPT-Suche?

Nein. OpenAI dokumentiert GPTBot als den Crawler für das Training generativer KI-Foundation-Models und OAI-SearchBot als den Crawler, der die Suchfunktionen von ChatGPT antreibt. Ein Disallow unter User-agent: GPTBot lässt OAI-SearchBot frei crawlen, die ChatGPT-Suche kann Ihre Seiten also weiterhin zeigen und zitieren.

Was passiert, wenn ich OAI-SearchBot sperre?

OpenAI gibt an, dass Websites, die aus OAI-SearchBot aussteigen, "nicht in ChatGPT-Suchantworten gezeigt werden, aber weiterhin als navigatorische Links erscheinen können." Sie verlieren das Zitat und den Klick, der damit kommt. OpenAI empfiehlt, OAI-SearchBot in robots.txt zuzulassen, damit eine Website in den Suchergebnissen erscheint.

Gibt es eine Anweisung, die alle OpenAI-Bots auf einmal sperrt?

Kein einzelnes Token deckt sie ab. OpenAI dokumentiert GPTBot, OAI-SearchBot, ChatGPT-User und OAI-AdsBot als getrennte robots.txt-User-Agent-Tokens, und jedes braucht seine eigene benannte Gruppe. Eine Wildcard-Gruppe User-agent: * gilt für regelkonforme Crawler, die keine Gruppe finden, die sie ausdrücklich nennt, ein Agent mit eigenem Block liest also diesen Block.

Welcher OpenAI-Agent ist kein Crawler?

ChatGPT-User. OpenAI dokumentiert ihn als zuständig für nutzerinitiierte Aktionen in ChatGPT und Custom GPTs, das heißt, er ruft eine Seite ab, weil eine Person ChatGPT gebeten hat, diesen Link zu öffnen. OpenAI merkt an, dass robots.txt-Regeln für ihn möglicherweise nicht auf dieselbe Weise gelten, da die Anfrage von einer aktiven Nutzeraktion abhängt.

Was macht OAI-AdsBot?

OpenAI dokumentiert OAI-AdsBot als den Agenten, der die Sicherheit von Webseiten prüft, die als ChatGPT-Anzeigen eingereicht werden, und gibt an, dass "die von OAI-AdsBot erhobenen Daten nicht zum Training generativer KI-Foundation-Models verwendet werden." Er hat ein eigenes robots.txt-Token und eine eigene veröffentlichte IP-Liste unter openai.com/adsbot.json. Er ist sowohl vom Trainings-Crawl als auch vom Such-Crawl getrennt.

Kann ein Crawler meine robots.txt-Datei ignorieren?

Ja. RFC 9309 beschreibt das Robots Exclusion Protocol als eine Menge von Regeln, die Crawler lesen, und sein Abschnitt Security Considerations stellt fest, dass das Protokoll "kein Ersatz für wirksame Maßnahmen zur Inhaltssicherheit ist". Nichts im Protokoll blockiert eine Anfrage auf der Netzwerkebene, alles, was privat bleiben muss, braucht also stattdessen eine Authentifizierung oder eine serverseitige Sperre.

Sollte ich die veröffentlichten IP-Bereiche von OpenAI fest hinterlegen, statt sie neu abzurufen?

Die IP-Listen von OpenAI enthalten ein Feld creationTime, das sich bei jeder Aktualisierung des Bereichs ändert, sodass eine fest hinterlegte Kopie beim nächsten Wechsel der Infrastruktur veraltet. Rufen Sie stattdessen openai.com/gptbot.json, searchbot.json, chatgpt-user.json oder adsbot.json regelmäßig neu ab, und behandeln Sie eine Anfrage mit einem OpenAI-User-Agent von einer Adresse außerhalb der aktuellen Liste als Fälschung, nicht als Crawler, der robots.txt ignoriert.

Warum sollte ich nicht direkt nach der ersten robots.txt-Änderung eine zweite vornehmen?

OpenAIs Dokumentation nennt für die Suche eine Ausbreitungszeit von rund 24 Stunden nach einer robots.txt-Aktualisierung. Eine zweite Änderung innerhalb dieses Zeitfensters trifft ein, bevor die erste vollständig wirkt, sodass sich das spätere Ergebnis keiner der beiden Änderungen eindeutig zuordnen lässt. Nehmen Sie eine Änderung vor, notieren Sie den Zeitpunkt, und warten Sie den vollen Tag ab, bevor Sie die Datei erneut anfassen.

Gibt mir robots.txt irgendeine rechtliche Handhabe gegenüber Crawlern?

RFC 9309 stellt in seinem einleitenden Abschnitt fest, dass robots.txt-Regeln "keine Form der Zugriffsautorisierung" sind. Eine Disallow-Zeile bittet einen regelkonformen Crawler, eine Seite auszulassen, verfügt aber über keinen Mechanismus gegen einen, der sich nicht daran hält. Inhalte, die wirklich geschützt werden müssen, gehören hinter eine Anmeldesperre oder eine serverseitige IP-Regel, während der robots.txt-Eintrag nur die Absicht dokumentiert.

Können GPTBot- und OAI-SearchBot-Regeln in derselben robots.txt-Datei stehen?

Das können sie, und genau diese Kombination aus Disallow für GPTBot und Allow für OAI-SearchBot ist die Einstellung, die OpenAIs Trennung für Website-Betreiber möglich macht, die aus dem Training aussteigen und trotzdem den Traffic aus der ChatGPT-Suche behalten wollen. Jede User-agent-Gruppe wird für sich gelesen, sodass sich der GPTBot-Block und der OAI-SearchBot-Block in derselben Datei nie gegenseitig stören.

Sieh uns öfter bei Google

Ein Klick macht RedReplier zu einer bevorzugten Quelle. Unsere Artikel stehen dann weiter oben in deinen Top-Meldungen, im KI-Modus und in den KI-Übersichten.

Bevor du gehst...

RedReplier

RedReplier

Erreichen Sie jeden Käufer, der nach Ihrem Angebot sucht

RedReplier überwacht Reddit, X, Bluesky und Hacker News in Echtzeit, bewertet jeden Thread nach Kaufabsicht und entwirft Ihre Antwort, damit Sie als Erster da sind.

Reddit, X, Bluesky & HN

Echtzeit-Kaufabsicht-Alerts

Unbegrenzte KI-Antworten

Nach Kaufabsicht sortiert

Verwandte Artikel