Jede siebte Googlebot-Anfrage war gefälscht
Wir haben jede Anfrage geprüft, die sich auf den von Centinel geschützten Nachrichten- und Medienseiten als bekannter Crawler ausgab. Auf der typischen Seite kam jede siebte Googlebot-Anfrage nicht von Google. Bei mehreren KI-Crawlern war die Mehrheit gefälscht.
- 14 %
- der Googlebot-Anfragen gefälscht
- 84 %
- der GPTBot-Anfragen gefälscht
- 99 %
- bei Claude-SearchBot und Perplexity-User
- 88 %
- der falschen Googlebots aus Rechenzentren
Eine Anfrage gilt als gefälscht, wenn die veröffentlichten IP-Bereiche oder der DNS-Abgleich des Betreibers ihr widersprechen. „Typische Seite“ ist der Median über alle Seiten. „Gesamter Traffic“ fasst alle Anfragen zusammen, sodass stark besuchte Seiten mehr zählen.
| Crawler | Typische Seite | Gesamter Traffic |
|---|---|---|
| Google-Extended | 99,9 % | 99,8 % |
| Perplexity-User | 99 % | 96 % |
| Claude-SearchBot | 99 % | 2 % |
| CCBot | 88 % | 44 % |
| GPTBot | 84 % | 2 % |
| Meta-ExternalAgent | 77 % | 2 % |
| ClaudeBot | 40 % | 6 % |
| Claude-User | 25 % | 24 % |
| PerplexityBot | 20 % | 19 % |
| Googlebot | 14 % | 6 % |
| ChatGPT-User | 12 % | 1 % |
| OAI-SearchBot | 12 % | 4 % |
Die beiden Werte liegen auseinander, weil sich echter Crawler-Traffic auf wenige große Seiten konzentriert. Auf der typischen Seite kommt der echte Crawler selten vorbei, also ist dort die Mehrheit der Anfragen unter seinem Namen gefälscht.
Google-Extended besucht nie eine Website
Google-Extended ist ein Steuer-Token für die robots.txt, kein Crawler. Laut Googles Dokumentation hat es keinen eigenen User-Agent. Jede Anfrage, die sich als Google-Extended ausgibt, ist gefälscht und lässt sich ohne weitere Prüfung sperren.
Woher die Fälschungen kommen
88 % der gefälschten Googlebot-Anfragen kamen aus Rechenzentren, rund ein Drittel davon von einem einzigen europäischen Hosting-Anbieter. Mindestens die Hälfte der gefälschten Anfragen im Namen von GPTBot, ClaudeBot, PerplexityBot und ChatGPT-User kam aus der Google Cloud.
Die Fälschungen zielen auf Artikel: 95 % der gefälschten Googlebot-Anfragen riefen Seiten ab statt Bilder, Skripte oder Stylesheets. Beim echten Googlebot waren es 85 %.
Die Versionsnummer verrät keine Fälschung
94 % der gefälschten Googlebot-Anfragen gaben die aktuelle Version des echten Googlebot an. Bei ChatGPT-User, Bingbot, Amazonbot und Claude-SearchBot war es bei jeder Fälschung so. Über alle Crawler hinweg nutzten 90 % der Fälschungen den vollständigen Browser-String.
Die Ausnahme ist CCBot: 99 % seiner Fälschungen sendeten nur den nackten Crawler-Namen ohne das übliche Mozilla/5.0 davor.
Freigabe nach Name lässt die Fälschungen durch
Eine verbreitete Regel lässt Such- und KI-Crawler anhand ihres User-Agents durch, damit eine Sperre nie Sichtbarkeit kostet. Mit dieser Regel wird jede Fälschung aus dieser Studie wie der echte Crawler behandelt.
- Prüfen Sie die Adresse gegen die veröffentlichte IP-Liste des Betreibers oder seinen Reverse- und Forward-DNS-Abgleich. Google, Bing, OpenAI, Anthropic und Perplexity veröffentlichen maschinenlesbare Listen.
- Halten Sie geprüft, widerlegt und unbekannt als getrennte Ergebnisse auseinander.
- Knüpfen Sie die Freigabe an den geprüften Betreiber, nicht an den Namen im Header.
Für den 15. bis 21. September haben wir die Prüfung von Centinel mit den Listen von Google, Bing, OpenAI und Perplexity abgeglichen: 99,99 % der als echt erkannten Anfragen kamen aus den veröffentlichten Bereichen, 98 % der nicht bestätigten Anfragen von außerhalb.
Einzelne IP-Adresse prüfenBots, die sich als Besucher ausgeben
Automatisierte Browser sind Headless- oder ferngesteuerte Browser mit echter Rendering-Engine. Sie nennen keinen Crawler-Namen, sondern geben sich als normale Besucher aus. 56 % gaben sich als Chrome aus, 70 % kamen aus Rechenzentren. Für sie gibt es keine veröffentlichte Liste. Um sie zu erkennen, braucht es Belege aus Browser und Verhalten.
So haben wir gemessen
Daten: Anfragen an Nachrichten- und Medienseiten, die von Centinel geschützt werden, von Ende Juni bis zum 21. September 2026, ohne Test- und Staging-Umgebungen. Jeder Wert ist ein Median über die Seiten oder ein Anteil am gesamten Traffic und beruht auf mindestens fünf Seiten. Einzelne Seiten lassen sich nicht zuordnen.
Prüfung: das vom Betreiber dokumentierte Verfahren, in dieser Reihenfolge: signierte Anfrage, wo unterstützt, veröffentlichte IP-Bereiche, dann Reverse- und Forward-DNS. Den Link-Vorschau-Abruf von Facebook und Semrush haben wir ausgeschlossen, weil ihre Prüfung nicht zuverlässig war. „Rechenzentrum“ heißt, dass die Adresse zu einem Hosting- oder Cloud-Netz gehört.
Daten und Zitierweise
Grafiken und Werte dürfen mit dieser Quellenangabe verwendet werden:
Centinel Analytica, "Fake crawlers: how often Googlebot and AI bots are not who they claim", September 2026, https://www.centinelanalytica.com/blog/fake-crawler-reportWie viele falsche Crawler erreichen Ihre Seite?
Der kostenlose Audit zeigt, welche getesteten Scraping-Werkzeuge Ihre Seiten abrufen können. Sie erhalten einen manuell geprüften Bericht mit betroffenen Seiten und möglichen Maßnahmen.