Crawling
Crawling ist der Prozess, bei dem Suchmaschinen automatisiert Websites besuchen und Seiteninhalte sowie Links erfassen.
Kurz erklärt
Suchmaschinen wie Google setzen automatisierte Programme (Crawler oder Bots, z. B. Googlebot) ein, die Websites besuchen, Inhalte auslesen und Links zu anderen Seiten verfolgen. So entdecken Suchmaschinen neue und aktualisierte Seiten, ohne dass sie manuell eingereicht werden müssen.
Beispiel
Der Googlebot besucht die Startseite einer Website, findet dort einen Link zu /produkte/, folgt diesem Link, findet dort weitere Produktseiten und crawlt diese ebenfalls - so entsteht schrittweise eine vollständige Sicht auf die Website-Struktur.
Warum ist das relevant?
Eine Seite, die nicht gecrawlt werden kann, kann in der Regel auch nicht indexiert und in Suchergebnissen angezeigt werden. Crawling-Effizienz ist besonders bei großen Websites relevant, da Suchmaschinen nur ein begrenztes “Crawl-Budget” pro Website aufwenden.
Häufige Missverständnisse
Crawling und Indexierung werden oft gleichgesetzt, sind aber unterschiedliche Schritte: Eine Seite kann gecrawlt, aber dennoch nicht indexiert werden (z. B. wegen noindex oder Duplicate Content). Auch das Sperren einer Seite über robots.txt verhindert nur das Crawling, nicht zwingend die Indexierung der URL selbst.