Zum Inhalt springen
Medien und Verlage

Entscheiden Sie, welche KI-Crawler und Scraper Ihre Inhalte lesen

Suchmaschinen, KI-Crawler, Assistenten und Scraper hinter einem Browser lesen dieselben Artikel. Centinel zeigt, wer wer ist. So behalten Verlage die Indexierung und geben jedem anderen Client genau den Zugriff, den sie wollen.

Kostenlosen Audit anfordern
Das Problem

Die robots.txt ist eine Bitte, keine Kontrolle

RFC 9309, der Standard für die robots.txt, stellt klar, dass ihre Regeln keine Zugangsberechtigung sind. Angegebene Crawler halten sich meist daran. Scraper, die sie ignorieren oder den Namen eines Crawlers kopieren, nicht. Manche Agenten, die eine Seite für einen Nutzer abrufen, wenden die robots.txt gar nicht an. OpenAI schreibt, dass die Regeln für ChatGPT-User möglicherweise nicht gelten.

KI-Crawler und robots.txt im Überblick
Wer Ihre Artikel liest

Drei Arten von Clients, drei Entscheidungen

  • KI-Crawler, mit und ohne Namen

    Trainings- und Such-Crawler der KI-Anbieter nennen sich meist selbst. Andere kommen mit einem Browser-User-Agent oder mit dem Namen eines bekannten Crawlers, der ihnen nicht gehört.

  • Archive und Paywalls kopiert

    Scraper durchlaufen Artikelarchive und Abo-Seiten, um Volltexte zu kopieren, teils über ein eingeloggtes Konto und einen echten Browser.

  • Agenten, die für Nutzer lesen

    KI-Assistenten und Browser-Agenten laden Seiten, wenn eine Person sie darum bittet. Das ist ein anderer Client als ein Massen-Crawler und eine andere Entscheidung.

Was Centinel tut

Suche offen halten, alles andere nach Ihren Regeln

  • Angegebene Crawler prüfen

    Centinel vergleicht die angegebene Identität eines Crawlers mit den Nachweisen, die sein Betreiber veröffentlicht, etwa IP-Bereiche oder DNS-Einträge. Der echte Googlebot indexiert weiter, ein kopierter Name bekommt kein automatisches Vertrauen.

    Crawler-IP prüfen
  • Eine Regel pro Crawler und Bereich

    Unterstützte Integrationen wenden die konfigurierte Reaktion für Identität und angefragte Ressource an: zulassen, drosseln, herausfordern oder blockieren. So bleibt die Suche offen, während KI-Trainings-Crawler abgewiesen oder nur für einzelne Bereiche zugelassen werden.

    KI-Crawler steuern
  • Belege gegen getarntes Scraping

    In unterstützten Browser-Integrationen bewertet Centinel Anfrage- und Browser-Signale auf Artikel- und Archivseiten, nicht nur den User-Agent. Ein Scraper, der sich als Leser ausgibt, kann gedrosselt oder herausgefordert werden, ohne Abonnenten denselben Check zuzumuten.

    Wie Bot-Erkennung funktioniert
Studie

Jede siebte Googlebot-Anfrage war gefälscht

Wir haben von Ende Juni bis zum 21. September 2026 jede Anfrage geprüft, die sich auf den von Centinel geschützten Nachrichten- und Medienseiten als bekannter Crawler ausgab. Auf der typischen Seite kam jede siebte Googlebot-Anfrage nicht von Google. Bei GPTBot waren es 84 %, bei Claude-SearchBot und Perplexity-User 99 %.

Zur Studie über gefälschte Crawler
Fragen

Häufige Fragen von Verlagen

Wie sperren Verlage KI-Crawler, ohne aus der Google-Suche zu fallen?
Sperren Sie die KI-spezifischen Crawler-Namen und lassen Sie Googlebot zu. Laut Google steuert das Token Google-Extended die Nutzung von Inhalten für Gemini und hat keinen Einfluss auf die Aufnahme in die Google-Suche. Auch andere KI-Anbieter veröffentlichen getrennte Namen für Trainings- und Such-Crawler.
Halten sich KI-Crawler an die robots.txt?
Die angegebenen Crawler der großen KI-Anbieter sagen das von sich. Scraper, die ihre Identität verbergen, tun es nicht, und Agenten, die eine Seite für einen Nutzer abrufen, wenden sie möglicherweise nicht an. Die robots.txt formuliert Ihren Wunsch. Durchsetzen lässt er sich nur auf dem Server.
Wie unterscheide ich einen echten GPTBot von einem gefälschten?
Prüfen Sie die Anfrage gegen die Nachweise des Betreibers, etwa die IP-Bereiche, die OpenAI für GPTBot veröffentlicht. Eine Anfrage mit diesem Namen von einer Adresse außerhalb dieser Bereiche ist kein GPTBot, egal was im User-Agent steht. Auf der typischen Nachrichtenseite in unserer Studie fielen 84 % der Anfragen im Namen von GPTBot durch diese Prüfung.
Lassen sich Artikel hinter der Paywall trotzdem scrapen?
Ja. Ein Scraper kann sich mit einem bezahlten Konto anmelden und Seiten in einem echten Browser lesen. Die Paywall allein hält ihn nicht auf. Aufschlussreich ist das Verhalten der Sitzung: wie schnell sie liest, wie viele Seiten sie abruft und ob der Browser automatisiert ist.

Sehen Sie, welche Bots Ihre Inhalte abrufen

Der kostenlose Audit zeigt, welche getesteten Scraping-Werkzeuge Ihre Seiten abrufen können. Sie erhalten einen manuell geprüften Bericht mit betroffenen Seiten und möglichen Maßnahmen. Eine Installation ist nicht nötig.