robots.txt
Die robots.txt ist eine Textdatei im Stammverzeichnis einer Website, die Suchmaschinen-Crawlern mitteilt, welche Bereiche sie crawlen dürfen.
Kurz erklärt
Die Datei liegt üblicherweise unter /robots.txt und enthält Regeln, die festlegen, welche Crawler auf welche Pfade zugreifen dürfen. Sie basiert auf dem Robots Exclusion Protocol, einem seit den 1990er-Jahren etablierten, freiwilligen Standard.
Beispiel
User-agent: *
Disallow: /admin/
Sitemap: https://example.de/sitemap.xml
Diese Regel erlaubt allen Crawlern den Zugriff auf die gesamte Website außer dem Bereich /admin/ und verweist zusätzlich auf die Sitemap.
Warum ist das relevant?
Eine falsch konfigurierte robots.txt kann versehentlich die gesamte Website vom Crawling ausschließen - ein häufiger, aber schwerwiegender Fehler bei Relaunches. Umgekehrt hilft eine durchdachte robots.txt, Crawl-Budget auf relevante Bereiche zu konzentrieren.
Häufige Missverständnisse
Ein Disallow in der robots.txt verhindert das Crawling, garantiert aber nicht, dass eine URL nicht indexiert wird - verlinkte URLs können trotzdem ohne Inhaltsvorschau in den Suchergebnissen erscheinen. Für einen zuverlässigen Ausschluss aus dem Index ist ein noindex-Meta-Tag oder HTTP-Header notwendig, der aber wiederum voraussetzt, dass die Seite crawlbar ist. Die robots.txt ist zudem kein Sicherheitsmechanismus - gelistete Pfade sind für jeden einsehbar.