glossary

Was CCBot für Common Crawls offenes Web-Archiv sammelt

Taras Shynkarenko
Taras Shynkarenko
Updated: 6 Min. gelesen
Was CCBot für Common Crawls offenes Web-Archiv sammeltWas CCBot für Common Crawls offenes Web-Archiv sammelt

TL;DR

6 Min. gelesen

Common Crawl betreibt CCBot, um ein kostenloses, offenes Archiv des Web aufzubauen, das sich laut Common Crawls eigener Dokumentation mit der exakten User-Agent-Zeichenfolge CCBot/2.0 ausgibt. Common Crawl gibt an, dass sein Korpus über 300 Milliarden seit 2007 gesammelte Seiten umfasst, und OpenAIs GPT-3-Paper dokumentiert, dass eine gefilterte Version von Common Crawl 410 Milliarden Tokens lieferte, 60 Prozent des Trainingsmixes dieses Modells. Ein einzelner User-agent: CCBot-Block in robots.txt entfernt eine Website aus jedem zukünftigen Crawl.

Was ist CCBot?

Common Crawl betreibt CCBot als den Crawler, der sein kostenloses, offenes Web-Archiv aufbaut, ein Projekt, das laut Common Crawl seit 2007 durchgehend läuft. Der Bot ruft Seiten so ab wie jeder andere Crawler, und Common Crawls eigene Website berichtet, dass das entstandene Korpus inzwischen über 300 Milliarden Seiten umfasst, mit 3 bis 5 Milliarden neuen Seiten pro Monat, geprüft am 9 September 2026. Dieses Archiv ist öffentlich, sodass jeder, einschließlich eines konkurrierenden KI-Labors, eines Universitätsforschers oder RedReplier, dieselben Seiten herunterladen kann, die CCBot gesammelt hat.

Wie lautet die User-Agent-Zeichenfolge von CCBot?

CCBot identifiziert sich mit der exakten Zeichenfolge CCBot/2.0 (https://commoncrawl.org/faq/), laut Common Crawls eigener CCBot-Dokumentation, geprüft am 9 September 2026. Common Crawl warnt auf derselben Seite, dass sich andere Crawler fälschlich als CCBot ausgeben, sodass die Zeichenfolge allein nur eine Behauptung ist, die eine Anfrage über sich selbst macht, kein Herkunftsnachweis. Gleichen Sie die Quell-IP-Adresse mit Common Crawls veröffentlichtem Bereich ab, bevor Sie dem Header vertrauen.

DetailWertQuelle
User-Agent-ZeichenfolgeCCBot/2.0 (https://commoncrawl.org/faq/)commoncrawl.org/ccbot
IP-ÜberprüfungAls JSON veröffentlicht unter index.commoncrawl.org/ccbot.jsoncommoncrawl.org/ccbot
robots.txt-TokenCCBotcommoncrawl.org/ccbot
KorpusgrößeÜber 300 Milliarden Seiten seit 2007commoncrawl.org

Reihen von Serverracks stehen für das Archiv, das Common Crawl aus jedem monatlichen Crawl zusammenstellt und speichert.

Was veröffentlicht Common Crawl?

Common Crawl veröffentlicht rohe Webseiten-Erfassungen zusammen mit Metadaten-Auszügen und Text-Auszügen, die aus jedem Crawl gezogen werden, und die eigene Website gibt an, dass das Archiv seit Projektbeginn 2007 auf über 300 Milliarden Seiten angewachsen ist. Der Mechanismus ist ein monatlicher Crawl-Zyklus: CCBot ruft einen frischen Satz von URLs ab, Common Crawl verpackt die Ergebnisse, und der verpackte Crawl wird ohne Login oder Gebühr für jeden herunterladbar. Eine Website, die ihre Seiten für diese Art der offenen Weiterverwendung verfügbar machen will, braucht überhaupt keine Konfiguration, da der Standardzustand offen ist.

Wie wirkt sich das Blockieren von CCBot auf KI-Trainingskorpora aus, die aus Common Crawl gebaut werden?

Das Blockieren von CCBot entfernt eine Website aus dem Archiv, das Common Crawl veröffentlicht, und dieses Archiv ist ein dokumentierter Input für KI-Trainingsarbeit, die außerhalb von Common Crawl selbst geleistet wird. OpenAIs Paper zu GPT-3, Brown et al., 2020, listet "Common Crawl (filtered)" in seiner Trainingsdaten-Tabelle mit 410 Milliarden Tokens, 60 Prozent des Trainingsmixes des Modells, die größte Einzelquelle in dieser Tabelle. Der Mechanismus läuft nur in eine Richtung: Eine Seite, die CCBot nie erfasst, kann in einem Common-Crawl-Snapshot nicht erscheinen, und ein Datensatz, den ein anderes Labor aus diesem Snapshot filtert, erbt dieselbe Abwesenheit, sodass eine Website ihre Exponierung gegenüber diesem spezifischen Weg ins KI-Training entscheidet, indem sie entscheidet, ob sie CCBot überhaupt hereinlässt.

CrawlerBetreiberWie er KI-Training speistrobots.txt-Token
CCBotCommon CrawlVeröffentlicht ein offenes Archiv, das externe Labore in Trainingsdaten filternCCBot
GPTBotOpenAICrawlt direkt, um OpenAIs eigene Foundation-Modelle zu trainierenGPTBot

Ein Entwickler bearbeitet eine Textdatei, die Art von Änderung, die nötig ist, um eine CCBot-Regel in robots.txt einzufügen.

Wie blockieren Sie CCBot in robots.txt?

Fügen Sie einen eigenen User-Agent-Block hinzu, der CCBot benennt, und blockieren Sie die Pfade, die Sie von jedem zukünftigen Crawl ausschließen wollen.

User-agent: CCBot
Disallow: /

Dieser einzelne Block, in genau dieser Form auf Common Crawls eigener CCBot-Seite veröffentlicht, stoppt CCBot davon, ab sofort irgendeine Seite der Website anzufordern, entfernt aber keine Seiten, die ein früherer Crawl bereits erfasst hat. Seiten, die schon in einem früheren Common-Crawl-Snapshot veröffentlicht wurden, bleiben in diesem Snapshot, sodass eine neue robots.txt-Regel nur Crawls ab diesem Zeitpunkt betrifft. Dieselbe Syntax akzeptiert einen engeren Pfad, wie Disallow: /private/, wenn nur ein Teil einer Website aus dem Archiv herausgehalten werden muss.

Wie überprüfen Sie eine Anfrage, die behauptet, CCBot zu sein?

Vergleichen Sie die Quell-IP-Adresse der Anfrage mit Common Crawls veröffentlichter CCBot-IP-Liste unter index.commoncrawl.org/ccbot.json, bevor Sie der User-Agent-Zeichenfolge allein vertrauen, da Common Crawls eigene Dokumentation gefälschten CCBot-Traffic als bekanntes Problem nennt. CCBots IPv4-Adressen tragen funktionierendes Reverse-DNS, was einen zweiten Weg gibt, den Ursprung einer Anfrage unabhängig vom Header zu bestätigen. Ein Besucher, der die CCBot-User-Agent-Zeichenfolge von einer Adresse außerhalb dieses veröffentlichten Bereichs sendet, ist nicht CCBot, egal was der Header sagt.

Wie eine robots.txt-Regel ein KI-Trainingsset erreicht
CCBot crawlt das offene Web für Common Crawl
Common Crawl veröffentlicht das Ergebnis als kostenloses, offenes Archiv
Externe Labore, wie OpenAI für GPT-3, filtern dieses Archiv in Trainingsdaten
Ein User-agent: CCBot-Block entfernt eine Website, bevor irgendetwas davon passiert
Mechanismus laut Common Crawls eigener CCBot-Seite und OpenAIs GPT-3-Paper (Brown et al., 2020), beide geprüft am 9 September 2026.

Sollte eine Website CCBot erlauben oder blockieren?

CCBot zu erlauben bedeutet, keine Disallow-Regel für seinen User-Agent hinzuzufügen, was eine Website in einem weit genutzten, kostenlosen Forschungsarchiv hält, das Common Crawl seit 2007 monatlich veröffentlicht. Es zu blockieren bedeutet, die obige zweizeilige Regel hinzuzufügen, was eine Website aus diesem Archiv heraushält und aus jedem nachgelagerten Datensatz, den ein anderes Labor daraus filtert, auf Kosten des Verlusts jeglichen Zitier- oder Entdeckungsvorteils, der aus dem Erscheinen in offener Forschung entsteht. Die Wahl ist dieselbe wie bei Amazonbot und Applebot-Extended: ein benannter Crawler mit dokumentiertem Zweck, kontrolliert durch eine Zeile, die ihn in robots.txt benennt.

Ob eine Seite überhaupt auf diese Weise gecrawlt und wiederverwendet werden darf, ist eine separate rechtliche Frage, behandelt in ist Web Scraping legal, die für CCBot genauso gilt wie für jeden Bot, der Inhalte von einer Website zieht, die er nicht besitzt. Sobald Inhalte auf einem solchen Weg eine KI-Antwort erreichen, verfolgt KI-Suche-Markenmonitoring, wie eine Marke am Ende in dieser Antwort dargestellt wird, was das Ergebnis ist, auf das es ankommt, sobald der Crawl selbst längst erledigt ist.

CCBot erlauben oder blockieren
CCBot erlauben
  • Bleibt im offenen Archiv, das Common Crawl seit 2007 betreibt
  • Keine Änderung an der robots.txt nötig, da offener Zugriff der Standard ist
  • Von externen KI-Labs, Universitäten und Wettbewerbern gleichermaßen nutzbar
CCBot blockieren
  • Eine zweizeilige robots.txt-Regel stoppt jeden zukünftigen Crawl
  • Ausgeschlossen aus jedem Datensatz, den ein anderes Lab aus dem Archiv filtert, etwa den Trainingsdaten von GPT-3
  • Bereits erfasste Seiten aus einem vergangenen Snapshot bleiben trotzdem veröffentlicht
Beide Wege werden auf Common Crawls eigener CCBot-Seite und in OpenAIs GPT-3-Paper (Brown et al., 2020) beschrieben.

Häufig gestellte Fragen

Entfernt das Blockieren von CCBot meine Website aus vergangenen Common-Crawl-Archiven?

Nein. Eine robots.txt-Regel stoppt nur zukünftige Crawls; sie reicht nicht in einen Common-Crawl-Snapshot hinein, der schon vor Bestehen der Regel veröffentlicht wurde. Seiten, die in einem früheren Crawl erfasst wurden, bleiben in dessen Archiv.

Woher weiß ich, dass eine Anfrage wirklich CCBot ist und kein gefälschter Crawler?

Gleichen Sie die Quell-IP-Adresse der Anfrage mit Common Crawls veröffentlichter CCBot-IP-Liste unter index.commoncrawl.org/ccbot.json ab. Common Crawls eigene Dokumentation gibt an, dass sich andere Crawler fälschlich als CCBot ausgeben, sodass der User-Agent-Header allein kein Beweis ist.

Verlangt Common Crawl Geld für den Zugriff auf sein Archiv?

Common Crawls eigene Website beschreibt das Korpus als kostenlos und offen, ohne Login oder Gebühr, um einen Crawl herunterzuladen. Dieser offene Zugang ist es, was externen Laboren erlaubt, ihre eigenen Datensätze daraus zu bauen.

Kann ich CCBot nur für einen Teil meiner Website blockieren?

Ja. Eine Disallow-Regel unter dem CCBot-User-Agent-Block akzeptiert einen bestimmten Pfad, wie Disallow: /private/, sodass der Rest der Website für denselben Crawler offen bleibt.

RedReplier
RedReplier

Loslegen

Reddit, X, Bluesky & HN

Echtzeit-Kaufabsicht-Alerts

Unbegrenzte KI-Antworten

Nach Kaufabsicht sortiert

Ist Common Crawl dasselbe wie der eigene Crawler eines KI-Unternehmens?

Nein. Common Crawl veröffentlicht ein offenes Archiv, das jede externe Organisation herunterladen und filtern kann, während ein Crawler wie GPTBot direkt für seinen eigenen Betreiber, OpenAI, crawlt, um die eigenen Modelle dieses Betreibers zu trainieren.

Wie oft veröffentlicht Common Crawl einen neuen Crawl?

Common Crawls eigene Website gibt an, dass sie jeden Monat 3 bis 5 Milliarden neue Seiten hinzufügt, als Teil eines Archivs, das seit 2007 läuft und inzwischen über 300 Milliarden Seiten umfasst. Eine zu einem beliebigen Zeitpunkt hinzugefügte robots.txt-Regel gilt ab diesem Crawl-Zyklus.

Welche Datenformate veröffentlicht Common Crawl aus jedem Crawl?

Common Crawl veröffentlicht rohe Webseiten-Erfassungen zusammen mit Metadaten-Extrakten und Text-Extrakten aus jedem monatlichen Crawl. Jeder dieser Downloads ist kostenlos und ohne Login verfügbar, sobald Common Crawl die Ergebnisse gepackt hat. Das daraus aufgebaute Archiv umfasst bereits über 300 Milliarden Seiten seit 2007.

Braucht CCBot eine Einrichtung, um eine neue Website zu crawlen?

CCBot crawlt eine Website standardmäßig, da Common Crawl offenen Zugriff ohne jede Konfiguration als Standardzustand nutzt. Eine Website muss nur handeln, um CCBot zu blockieren, mit der zweizeiligen robots.txt-Regel, die den CCBot-User-Agent benennt.

Warum ist OpenAIs GPT-3-Paper relevant für die Entscheidung, CCBot zu blockieren?

OpenAIs Paper zu GPT-3, Brown et al. 2020, führt "Common Crawl (gefiltert)" als größte einzelne Quelle in seiner Trainingsdaten-Tabelle auf, mit 410 Milliarden Tokens und 60 Prozent des Trainingsmixes des Modells. Dieser gefilterte Datensatz geht auf Seiten zurück, die CCBot erfasst hat, sodass eine Seite, die CCBot nie crawlt, in einer solchen Tabelle nicht auftauchen kann.

Was ist die Reverse-DNS-Prüfung von CCBot?

CCBots veröffentlichte IPv4-Adressen tragen laut Common Crawls eigener Dokumentation funktionierende Reverse-DNS-Einträge. Das gibt einer Website eine zweite Möglichkeit, die Herkunft einer Anfrage zu bestätigen, unabhängig vom Abgleich der IP mit Common Crawls veröffentlichter Liste.

Sieh uns öfter bei Google

Ein Klick macht RedReplier zu einer bevorzugten Quelle. Unsere Artikel stehen dann weiter oben in deinen Top-Meldungen, im KI-Modus und in den KI-Übersichten.

Bevor du gehst...

RedReplier

RedReplier

Erreichen Sie jeden Käufer, der nach Ihrem Angebot sucht

RedReplier überwacht Reddit, X, Bluesky und Hacker News in Echtzeit, bewertet jeden Thread nach Kaufabsicht und entwirft Ihre Antwort, damit Sie als Erster da sind.

Reddit, X, Bluesky & HN

Echtzeit-Kaufabsicht-Alerts

Unbegrenzte KI-Antworten

Nach Kaufabsicht sortiert

Verwandte Artikel