Welche KI-Bots sollte ich in meiner robots.txt erlauben?
Mit Thomas Sander und Gorden Wübbe

Die robots.txt ist ein Türschild für Bots, kein Schloss. In dieser Folge geht es darum, warum Such-Bots und Trainings-Bots von OpenAI, Anthropic und Perplexity getrennt behandelt werden sollten, warum man den Googlebot nicht aussperren sollte und wie man nach einer Änderung prüft, ob die eigene Seite noch erreichbar ist.
Quellen dieser Folge
Transkript
Einleitung
Thomas: Gorden, worum geht's heute?
Gorden: Die robots.txt.
Thomas: Genau. Klingt nach Science-Fiction. Ist aber eher ein Zettel an der Tür.
Gorden: Der Vergleich ist gar nicht schlecht. Stell dir ein Hotelzimmer vor. Du hängst das Schild „Bitte nicht stören“ an die Klinke.
Thomas: Und dann kommt keiner rein.
Gorden: Dann kommt keiner rein, der sich an Schilder hält. Abschließen tut das Schild die Tür nicht.
Was ist die robots.txt?
Thomas: Okay, ganz langsam für alle, die das zum ersten Mal hören. Was steht in so einer Datei?
Gorden: Da steht drin, welche Bereiche deiner Website automatische Programme besuchen dürfen. Diese Programme heißen Crawler. Man kann auch Bots sagen. Die klappern Websites ab und lesen sie.
Thomas: Und die robots.txt ist dann das Türschild für diese Bots.
Gorden: Genau. Die Idee gibt's seit den Neunzigern. Inzwischen ist sie sogar ein offizieller Internet-Standard. Und in diesem Standard steht ausdrücklich: Diese Regeln sind keine Zugangskontrolle.
Thomas: Also wirklich nur ein Schild. Kein Schloss.
Gorden: Nur ein Schild. Die Bots werden gebeten, sich daran zu halten. Die großen Anbieter schreiben in ihren Dokumentationen, wie ihre Bots die Datei lesen.
Warum KI-Bots jetzt wichtig sind
Thomas: Und warum reden wir ausgerechnet jetzt darüber? Die Datei ist ja nicht neu.
Gorden: Weil an deiner Tür inzwischen ganz neue Besucher klingeln. Die Bots von ChatGPT, Claude, Perplexity. Und die wollen ganz unterschiedliche Dinge.
Thomas: Moment. Unterschiedliche Dinge? Ich dachte, KI-Bot ist KI-Bot.
Gorden: Das ist der häufigste Denkfehler. Grob gibt es zwei Sorten. Die einen suchen. Die anderen lernen.
Suchen oder lernen
Thomas: Erklär mal.
Gorden: Nimm OpenAI. Die haben einen Bot namens OAI-SearchBot. Der holt Websites in die Suche von ChatGPT. Und dann gibt es GPTBot. Der sammelt Inhalte, die für das Training der KI-Modelle genutzt werden können.
Thomas: Und die kann ich getrennt behandeln?
Gorden: Ja. OpenAI schreibt selbst, dass die Einstellungen unabhängig voneinander sind. Du kannst den Such-Bot reinlassen und den Trainings-Bot aussperren.
Thomas: Und wenn ich den Such-Bot aussperre?
Gorden: Dann taucht deine Seite laut OpenAI nicht in den Suchantworten von ChatGPT auf. Höchstens noch als einfacher Link.
Thomas: Autsch. Das ist, als würdest du den Postboten nicht reinlassen und dich dann wundern, dass keine Briefe kommen.
Gorden: Schönes Bild. Bei Anthropic, der Firma hinter Claude, ist es ähnlich. Claude-SearchBot ist für die Suche. Wer ihn sperrt, kann laut Anthropic in den Suchergebnissen weniger sichtbar sein. ClaudeBot dagegen sammelt Inhalte, die ins Training einfließen können.
Thomas: Und Perplexity?
Gorden: PerplexityBot ist laut Perplexity für die Suche da und wird nicht fürs Training genutzt. Perplexity empfiehlt sogar ausdrücklich, ihn in der robots.txt zu erlauben.
Google ist ein Sonderfall
Thomas: Jetzt die Frage, die bestimmt viele haben: Kann ich Google die KI-Antworten einfach verbieten? Diese KI-Übersichten ganz oben?
Gorden: Da wird's knifflig. Google sagt: KI ist fester Teil der Suche. Die Regeln für den normalen Googlebot sind auch die Regeln für die KI-Funktionen in der Google-Suche.
Thomas: Heißt: Wer den Googlebot aussperrt …
Gorden: … sperrt sich bei Google gleich mit aus. Das wäre wie das Ladenschild abschrauben, weil einem die Schaufensterdeko nicht gefällt.
Thomas: Und was mache ich stattdessen?
Gorden: Google nennt dafür eigene Steuerbefehle direkt auf der Seite. Zum Beispiel „nosnippet“. Damit begrenzt du, was Google aus deiner Seite anzeigt.
Wenn ein Mensch fragt
Thomas: Jetzt hab ich gelesen, manche Bots halten sich gar nicht an das Türschild. Stimmt das?
Gorden: Bei einer Sorte muss man genau hinschauen. Das sind Abrufe, die ein Mensch auslöst. Stell dir vor, jemand schreibt in ChatGPT: Schau dir mal diese Seite an.
Thomas: Dann geht ChatGPT los und holt die Seite.
Gorden: Genau. Dafür nutzt OpenAI ChatGPT-User. Und OpenAI schreibt: Weil ein Nutzer das auslöst, gelten die Regeln der robots.txt dafür möglicherweise nicht.
Thomas: Also klingelt da quasi der Gast selbst, nicht der Hausmeister.
Gorden: So ungefähr. Anthropic macht es übrigens anders. Den Claude-User kannst du laut Anthropic über die robots.txt steuern.
Thomas: Und was mache ich, wenn ich einen Bereich wirklich zu haben will?
Gorden: Dann reicht ein Schild nicht. Dann brauchst du ein Schloss. Also ein Passwort oder eine Anmeldung.
Ein Schild ist kein Schloss
Thomas: Da fällt mir was ein. Wenn die robots.txt öffentlich ist …
Gorden: … kann sie jeder lesen. Ja.
Thomas: Dann ist ein Eintrag wie „Bitte nicht in den Ordner mit den geheimen Zahlen“ ja eher eine Schatzkarte.
Gorden: Ha! Ja. Mein Rat: Geheime Bereiche gehören hinter ein Passwort. Nicht auf ein Türschild, das jeder lesen kann.
So baust du die Datei
Thomas: Okay. Wie sieht so eine Datei denn praktisch aus?
Gorden: Du schreibst immer zuerst, für wen die Regel gilt. Das heißt User-agent. Also der Name des Bots. Und darunter, was er nicht darf. Das heißt Disallow.
Thomas: Und wenn ich alle Bots auf einmal meine?
Gorden: Dann gibt's den Stern als Platzhalter für alle. Aber Vorsicht: Hat ein Bot eine eigene Gruppe, folgt er seiner Gruppe. Was beim Stern steht, gilt dann nicht automatisch auch für ihn.
Thomas: Das heißt, ich sollte jeden wichtigen Bot einzeln aufführen.
Gorden: Das ist unsere Empfehlung, ja. Die Such-Bots in eine Gruppe, die du erlaubst. Die Trainings-Bots in eine eigene Gruppe. Dann siehst du auf einen Blick, wer was darf.
Testen und prüfen
Thomas: Wie merke ich denn, ob ich mich aus Versehen selbst ausgesperrt habe?
Gorden: Erstens: Ruf die Datei einfach im Browser auf. Deine Domain, Schrägstrich, robots.txt. Da sollte normaler Text kommen, keine Fehlerseite.
Thomas: Das kann sogar ich.
Gorden: Eben. Zweitens: Schau nach ein paar Tagen in die Protokolle deines Servers. Kommen die Such-Bots noch durch? Bleiben die gesperrten Bots weg?
Thomas: Und kann sich ein Bot auch als jemand anderes ausgeben?
Gorden: Ja. Common Crawl schreibt zum Beispiel, dass es falsche Bots gibt, die sich als ihr CCBot ausgeben. Echte Anfragen lassen sich über eine Rückwärts-Abfrage der Adresse prüfen.
Thomas: Also wie ein Ausweis an der Tür.
Gorden: Genau. Mein Tipp: Vergleich die Liste regelmäßig mit den offiziellen Dokumentationen der Anbieter.
Fazit
Thomas: Fassen wir zusammen. Für Normalos.
Gorden: Erstens: Die robots.txt ist ein Türschild, kein Schloss. Zweitens: Such-Bots und Trainings-Bots getrennt entscheiden. Drittens: Den Googlebot nicht aussperren, nur weil du KI nicht magst. Viertens: Nach jeder Änderung testen.
Thomas: Und wer wissen will, ob die eigene Seite für die KI-Bots überhaupt erreichbar ist?
Gorden: Dafür gibt's den kostenlosen GEO-Check auf geo-tool.com. Der prüft zum Beispiel, ob Crawler deine Seite erreichen. Den ganzen Artikel mit allen Regeln findest du in der Beschreibung.
Thomas: Und ich häng mir jetzt ein Schild an die Bürotür. „Bitte nicht stören. Gilt nicht für Kaffee.“
Gorden: Der Kaffee hält sich garantiert nicht dran. Bis zum nächsten Mal.