Die wichtigsten Befehle
- User-agent: * – die folgenden Regeln gelten für alle Crawler; mit einem Namen wie Googlebot nur für diesen.
- Disallow: /intern/ – dieser Pfad darf nicht abgerufen werden. Ein leeres Disallow: erlaubt alles.
- Allow: /intern/info.html – erlaubt eine Ausnahme innerhalb eines gesperrten Bereichs.
- * steht für beliebige Zeichen, $ für das Ende der Adresse, z. B. Disallow: /*.pdf$.
- Sitemap: https://…/sitemap.xml – zeigt Suchmaschinen Ihre Sitemap.
Häufige Fehler
- „Disallow: /“ vergessen: nach dem Relaunch bleibt die Sperre der Testseite stehen – und die Website verschwindet aus Google.
- CSS und JavaScript sperren: Google kann die Seite dann nicht richtig darstellen und bewerten.
- robots.txt statt noindex: Gesperrte Seiten können trotzdem im Index landen. Zum Ausschließen dient „noindex“.
- Datei an der falschen Stelle: Sie muss direkt unter ihre-domain.de/robots.txt liegen, nicht in einem Unterordner.
KI-Crawler: Training oder Suche?
Die großen KI-Anbieter nutzen getrennte Crawler: einige sammeln Inhalte für das Training ihrer Modelle, andere rufen Seiten ab, um aktuelle Fragen zu beantworten und Quellen zu verlinken. Mit „Nur KI-Training sperren“ schließen Sie die Trainings-Crawler aus, bleiben aber in KI-Antworten sichtbar.
Training
GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended, Meta-ExternalAgent, Bytespider
Suche und Nutzeranfragen
OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User
Google-Extended betrifft nur die Nutzung für Gemini – Ihre Platzierung in der Google-Suche ändert sich dadurch nicht.
Wird Ihre Website richtig gefunden?
Der kostenlose Website-Check prüft Titel, Indexierung, Ladezeit und Datenschutz-Punkte Ihrer Seite. Wenn mehr zu tun ist: Wir bauen Websites, die bei Google und in KI-Suchen gefunden werden.
Website erstellen lassenHäufige Fragen zur robots.txt
Was ist eine robots.txt?
Eine Textdatei im Hauptverzeichnis Ihrer Website, die Suchmaschinen und anderen Crawlern sagt, welche Bereiche sie abrufen dürfen. Seriöse Crawler halten sich daran, technisch erzwingen lässt es sich nicht.
Verhindert die robots.txt, dass eine Seite bei Google erscheint?
Nein. Sie verhindert nur das Abrufen. Ist eine gesperrte Seite von anderswo verlinkt, kann Google die Adresse trotzdem anzeigen. Wer eine Seite aus den Suchergebnissen heraushalten will, nutzt das Meta-Tag „noindex“ – und sperrt die Seite dann gerade nicht in der robots.txt.
Brauche ich überhaupt eine robots.txt?
Nicht zwingend. Ohne Datei dürfen Crawler alles abrufen. Sinnvoll ist sie, um die Sitemap anzugeben, unwichtige Bereiche wie Warenkorb oder interne Suche auszuschließen und KI-Crawler zu steuern.
Soll ich KI-Crawler sperren?
Für die meisten Unternehmen ist ein Mittelweg sinnvoll: das Training von KI-Modellen sperren, KI-Suchen wie ChatGPT-Suche oder Perplexity aber erlauben. So können KI-Assistenten Ihre Seite weiterhin empfehlen und verlinken.
Wie teste ich meine robots.txt?
Rufen Sie ihre-domain.de/robots.txt im Browser auf. In der Google Search Console zeigt der robots.txt-Bericht, welche Version Google kennt und ob es Fehler gibt.