Hebel eins: KI-Crawler-Steuerung
Aufwandsklasse: niedrig. Wirkungsklasse: Voraussetzung. Falsche Einstellungen können dazu führen, dass ein Unternehmen in der KI-Suche nicht erscheint.
KI-Plattformen betreiben eigene Crawler, die das Web durchsuchen, um Inhalte für Training oder Echtzeit-Antworten zu sammeln. Im Normalfall ist nichts davon blockiert: Eine Website ohne oder mit leerer robots.txt lässt alle Crawler zu. Ein Ausschluss muss also aktiv eingestellt worden sein. Solche Ausschlüsse kommen vor, oft ohne bewusste Entscheidung des Unternehmens.
Mögliche Gründe:
- Infrastruktur-Dienste mit Block als Standard. Der wichtigste Fall: Cloudflare, über dessen Netzwerk rund 20 Prozent des Webs laufen, blockiert seit dem 1. Juli 2025 KI-Crawler bei allen neu hinzugefügten Domains standardmäßig. Über eine Million Kunden hatten den Block schon vorher per Klick aktiviert. Wer seine Website hinter Cloudflare betreibt und nach Mitte 2025 aufgesetzt hat, ist möglicherweise blockiert, ohne die robots.txt angefasst zu haben.29 Ähnliche Effekte können vorgeschaltete WAFs (Web Application Firewalls, Schutz-Schichten zwischen Internet und Webserver) erzeugen, etwa Sucuri oder Bot-Filter einzelner Hosting-Pakete.
- Schalter im CMS oder Baukasten. Einige Website-Baukästen und CMS-Plugins (WordPress-SEO-Plugins, Shop-Systeme) hatten zeitweise prominent platzierte „KI-Bots blockieren“-Optionen eingeführt. Einige Website-Verantwortliche haben diesen Schalter aktiviert, z.B. aus Datenschutzgründen. Der Block kann ungewollt bis heute aktiv sein.
- Bewusste Grundsatzentscheidung. Manche Unternehmen haben 2023/24 aktiv entschieden, KI-Bots auszusperren, um nicht „kostenlos KI-Modelle zu trainieren“. Eine damals nachvollziehbare Haltung, deren Kehrseite fehlende Sichtbarkeit ist.
- Vorlagen der Webagentur. Viele KMU-Websites werden von Dienstleistern betreut, die eine Standard-robots.txt ausrollen. Stammt deren Vorlage aus der Hochphase der „KI-frisst-unsere-Inhalte“-Debatte, kann noch ein Block enthalten sein.
Crawler-Steuerung erfolgt klassisch über die robots.txt im Stammverzeichnis der eigenen Website. Beispiel für eine sinnvolle Konfiguration eines B2B-Unternehmens, das in der KI-Suche sichtbar werden möchte:
Spezifische Bereiche (Login, interne Bereiche) lassen sich gezielt ausschließen mit „Disallow: /interner-bereich/“. Eine pauschale Blockade aller KI-Crawler ist in den meisten Fällen nicht sinnvoll, eine differenzierte robots.txt eventuell schon. So können einzelne Bereiche gezielt ausgenommen werden, etwa Seiten mit personenbezogenen Daten wie Team-Profile.
16.1Was die Datenlage sagt#
Wer KI-Crawler blockiert, taucht in den entsprechenden KI-Antworten deutlich seltener oder gar nicht auf. Das gilt besonders für Plattformen mit Echtzeit-Zugriff (Perplexity, ChatGPT Search, AI Overviews). Für Trainingsdaten-basierte Antworten (ChatGPT Standard, Claude Standard) ist es etwas komplizierter, weil das Modell ältere, vor der Blockade gecrawlte Inhalte noch enthalten kann. Die Tendenz ist aber dieselbe.
16.2Umsetzung im KMU#
- Schritt 1: Aktuelle robots.txt prüfen. Sie liegt unter „ihre-domain.de/robots.txt“ und ist öffentlich einsehbar.
- Schritt 2: Falls KI-Crawler blockiert sind, mit der IT oder dem Webagentur-Partner abstimmen, ob es einen guten Grund dafür gibt.
- Schritt 3: Die robots.txt anpassen wie oben gezeigt. Veränderungen werden binnen Tagen von den Crawlern erfasst.
- Schritt 4: Nach vier Wochen in den Server-Logfiles prüfen, ob bzw. welche Crawler tatsächlich vorbeischauen.
Erscheinen dort gar keine KI-Crawler, liegt der Block vermutlich auf einer vorgelagerten Schicht (Cloudflare, WAF, Security-Plugin) – dann beim Hoster oder Web-Dienstleister nachfragen.
16.3Typische Fehler#
- Blanke „Disallow: /“ für alle KI-Bots aus Vorsicht oder Unkenntnis übernommen.
- Verwechslung von Googlebot und Google-Extended. Wer Google-Extended blockiert, schließt sich von Gemini und AI-Overviews-Training aus, ohne dass der klassische Googlebot betroffen wäre.
- Annahme, dass eine Blockade in robots.txt Inhalte aus Trainingsdaten entfernt. Sie verhindert nur zukünftiges Crawling. Bereits gecrawlte Inhalte bleiben in alten Modellen.
Stand:

