Zum Inhalt springen
KI-Crawler

KI-Crawler erkennen, blockieren und steuern

Was KI-Crawler sind, welche Namen die großen Anbieter verwenden, wie Sie sie per robots.txt ausschließen und warum die robots.txt allein Ihre Inhalte nicht schützt.

Kostenlosen Audit anfordern
Grundlagen

Was ist ein KI-Crawler?

Ein KI-Crawler ruft Webseiten automatisch ab, um Inhalte für ein KI-System zu sammeln. Die großen Anbieter unterscheiden drei Zwecke: Crawler für das Training von Modellen, Crawler für eine KI-Suche und Abrufe, die ein Assistent im Auftrag eines Nutzers macht.

Sie können deshalb nach Zweck entscheiden: das Training ausschließen und trotzdem in KI-Suchen auftauchen, oder Abrufe für Nutzer erlauben und Massen-Crawling sperren. Eine Regel pro Zweck ist genauer als eine Regel pro Anbieter.

Übersicht

Die wichtigsten KI-Crawler und ihre Namen

  • OpenAI

    GPTBot, OAI-SearchBot, ChatGPT-User

    GPTBot sammelt Inhalte für das Modelltraining, OAI-SearchBot für die Suche in ChatGPT. ChatGPT-User ruft Seiten ab, wenn ein Nutzer darum bittet. Laut OpenAI gelten robots.txt-Regeln dafür möglicherweise nicht. Dokumentation (öffnet in neuem Tab)

  • Anthropic

    ClaudeBot, Claude-SearchBot, Claude-User

    ClaudeBot sammelt Trainingsdaten, Claude-SearchBot dient der Suche, Claude-User ruft Seiten für Nutzer ab. Anthropic gibt an, robots.txt und Crawl-delay zu beachten. Dokumentation (öffnet in neuem Tab)

  • Google

    Google-Extended

    Kein eigener Crawler, sondern ein Steuer-Token in der robots.txt. Es regelt die Nutzung Ihrer Inhalte für Gemini und hat laut Google keinen Einfluss auf die Google-Suche. Dokumentation (öffnet in neuem Tab)

  • Perplexity

    PerplexityBot, Perplexity-User

    PerplexityBot indexiert für die Suche. Perplexity-User ruft Seiten für Nutzer ab und ignoriert die robots.txt laut Perplexity in der Regel. Dokumentation (öffnet in neuem Tab)

  • Apple

    Applebot-Extended

    Wie Google-Extended ein reines Steuer-Token: Es crawlt nicht selbst, sondern regelt, ob Apple bereits gecrawlte Inhalte für KI-Training nutzen darf. Dokumentation (öffnet in neuem Tab)

robots.txt

KI-Crawler per robots.txt ausschließen

Die robots.txt liegt im Stammverzeichnis Ihrer Domain. Jede Gruppe nennt einen User-Agent und die Pfade, die er nicht abrufen soll. So bitten Sie GPTBot, die ganze Website auszulassen:

User-agent: GPTBot
Disallow: /

Training bei Anthropic und Gemini ausschließen, Google-Suche behalten:

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Einen Bereich freigeben und den Rest sperren. Die spezifischere Regel gewinnt:

User-agent: GPTBot
Disallow: /archiv/
Allow: /archiv/oeffentlich/

Prüfen Sie die Datei nach jeder Änderung auf der echten Domain, einschließlich Weiterleitungen und CDN-Regeln. Crawler dürfen die robots.txt zwischenspeichern, eine Änderung wirkt deshalb nicht sofort. Tragen Sie keine geheimen Pfade ein: Die Datei ist öffentlich.

Grenzen

Warum die robots.txt nicht reicht

RFC 9309, der Standard für die robots.txt, sagt ausdrücklich, dass ihre Regeln keine Zugangsberechtigung sind. Die Datei ist eine Bitte. Sie prüft keine Identität, begrenzt keine Anfragen und fordert keine Sitzung heraus.

Den User-Agent wählt der Client selbst. In unserer Studie war auf der typischen Nachrichtenseite jede siebte Anfrage im Namen von Googlebot gefälscht, bei GPTBot waren es 84 %. Wer Crawler nach ihrem Namen durchlässt, lässt auch diese Fälschungen durch.

Durchsetzen lässt sich eine Regel nur dort, wo die Anfrage ankommt: mit einer Prüfung gegen die IP-Listen oder den DNS-Abgleich des Betreibers und mit Belegen aus Verbindung, Browser und Verhalten für Bots, die sich als Besucher ausgeben.

Fragen

Häufige Fragen zu KI-Crawlern

Was ist ein KI-Crawler?
Ein KI-Crawler ist ein Programm, das Webseiten automatisch abruft, um Inhalte für KI-Modelle, KI-Suchen oder KI-Assistenten zu sammeln. Die großen Anbieter trennen dabei Crawler für das Training, für die Suche und für Abrufe im Auftrag eines Nutzers.
Wie blockiere ich KI-Crawler?
Tragen Sie die Namen der Crawler, die Sie ausschließen wollen, mit Disallow in Ihre robots.txt ein. Das wirkt bei Crawlern, die sich daran halten. Für Scraper, die die robots.txt ignorieren oder einen fremden Namen verwenden, brauchen Sie eine Kontrolle auf dem Server, die die Identität prüft.
Verliere ich Google-Rankings, wenn ich KI-Crawler sperre?
Nicht, wenn Sie Googlebot zulassen. Google-Extended steuert die Nutzung für Gemini und hat laut Google keinen Einfluss auf die Aufnahme oder das Ranking in der Google-Suche.
Halten sich KI-Crawler an die robots.txt?
Die angegebenen Crawler der großen Anbieter sagen das von sich. Abrufe im Auftrag eines Nutzers sind teilweise ausgenommen, und Scraper, die ihre Identität verbergen, halten sich nicht daran. Ob ein Crawler echt ist, zeigt nur die Prüfung gegen die Nachweise des Betreibers.

Sehen Sie, welche Bots Ihre Inhalte abrufen

Der kostenlose Audit zeigt, welche getesteten Scraping-Werkzeuge Ihre Seiten abrufen können. Sie erhalten einen manuell geprüften Bericht mit betroffenen Seiten und möglichen Maßnahmen. Eine Installation ist nicht nötig.