Crawling

Crawling bezeichnet das systematische Abrufen von Webseiten durch ein automatisiertes Programm. Ein Crawler folgt Verweisen von Seite zu Seite, lädt die gefundenen Dokumente herunter und übergibt sie zur weiteren Verarbeitung — bei Suchmaschinen an die Indexierung.

Crawling und Indexierung werden regelmäßig gleichgesetzt, sind aber zwei getrennte Vorgänge. Eine Seite kann abgerufen und trotzdem nicht aufgenommen werden. Umgekehrt kann eine Seite in den Ergebnissen erscheinen, deren Inhalt nie abgerufen wurde — dann allerdings ohne Beschreibung.

Wie ein Crawler vorgeht

Am Anfang steht eine Liste bekannter Adressen, gespeist aus vorherigen Durchläufen, eingereichten Sitemaps und Verweisen von anderen Seiten. Aus dieser Liste wird nach Priorität abgerufen, der Inhalt wird gespeichert, und die darin gefundenen Verweise wandern zurück in die Liste. Der Vorgang läuft ohne Ende.

Vor jedem Abruf prüft ein regelkonformer Crawler die robots.txt der Domain. Welche Kennzeichen dabei zu welchem Dienst gehören, dokumentiert Google in seiner Übersicht der Crawler.

Vom Abruf zur AufnahmeEntdeckenAdressen aus Verweisen, Sitemap und früheren DurchläufenAbrufenPrüfung der robots.txt, dann Laden des DokumentsVerarbeitenAuslesen von Text und Struktur, gegebenenfalls RenderingIndexierenEntscheidung über die Aufnahme in den Index
Crawling und Indexierung sind zwei getrennte Schritte. Eine Seite kann abgerufen und trotzdem nicht aufgenommen werden — das ist der Normalfall, nicht die Ausnahme.

Crawl-Budget

Kein Crawler ruft unbegrenzt ab. Die Menge, die eine Domain in einem Zeitraum erhält, ergibt sich aus zwei Größen: was der Server verkraftet, ohne langsam zu werden, und wie viel Aufmerksamkeit die Domain aus Sicht der Suchmaschine verdient.

Für kleine Websites ist das selten ein Thema. Kritisch wird es bei vielen URLs — und besonders dann, wenn ein großer Teil davon wertlos ist. Werden Zehntausende bedeutungsloser Adressen abgerufen, verzögert sich die Entdeckung der Seiten, auf die es ankommt. Fehlerhafte Filter- und Sortierparameter, Kalenderansichten mit endloser Blätterfunktion und Reste früherer Systeme sind die häufigsten Ursachen.

Was Crawling verhindert

  • Ausschluss in der robots.txt. Der offensichtliche Fall — und der, der am häufigsten unbeabsichtigt eintritt, etwa wenn eine Sperre aus der Entwicklungsphase in den Livebetrieb übernommen wird.
  • Fehlende Verweise. Eine Seite, auf die nirgends verlinkt wird und die in keiner Sitemap steht, wird nicht gefunden. Sie ist nicht gesperrt, sondern unbekannt.
  • Serverfehler und Zeitüberschreitungen. Wiederholt fehlerhafte Antworten führen dazu, dass die Abrufrate zurückgefahren wird.
  • Inhalte, die erst durch Skripte entstehen. Was ausschließlich nach Ausführung von JavaScript sichtbar wird, erfordert einen zusätzlichen Verarbeitungsschritt — der stattfindet, aber später und nicht bei allen Systemen.

Der letzte Punkt wiegt bei KI-Systemen schwerer als bei Google. Viele AI Crawler verarbeiten ausschließlich das ausgelieferte HTML und führen keine Skripte aus. Was erst im Browser entsteht, existiert für sie nicht.

Logfile statt Vermutung

Über das tatsächliche Abrufverhalten gibt es genau eine verlässliche Quelle: das Serverlogfile. Es hält fest, wer wann welche Adresse angefordert hat und welche Antwort zurückging — ohne Stichprobe und ohne Hochrechnung.

Drei Fragen lassen sich daraus beantworten, die sonst offenbleiben. Welche Bereiche werden abgerufen und welche nie? Häufig zeigt sich, dass ein großer Teil der Zugriffe auf Adressen entfällt, die geschäftlich bedeutungslos sind. Welche Antworten gehen zurück? Eine wachsende Zahl von Fehlern oder Weiterleitungsketten senkt die Abrufrate, ohne dass es an anderer Stelle auffällt. Wer ruft ab? Neben den Suchmaschinen erscheinen dort inzwischen zahlreiche weitere automatisierte Zugriffe, deren Herkunft sich nur über den Abgleich der IP-Adresse belegen lässt.

Die Auswertung lohnt sich nicht wöchentlich, aber einmal zu Beginn einer Optimierung und danach in größeren Abständen. Sie ersetzt die verbreitete Annahme darüber, was gecrawlt wird, durch eine Feststellung.

Häufige Fragen

Wie oft wird eine Website abgerufen?

Das hängt von Änderungshäufigkeit, Bedeutung und Servergeschwindigkeit ab. Eine Nachrichtenseite wird mehrmals täglich abgerufen, eine selten geänderte Unternehmensseite unter Umständen im Abstand mehrerer Wochen. Verlässliche Angaben liefert nur das Serverlogfile.

Bedeutet häufiges Crawling eine bessere Platzierung?

Nein. Die Abrufhäufigkeit ist ein Hinweis auf wahrgenommene Bedeutung und Aktualität, kein Bewertungsmerkmal. Eine Seite steigt nicht, weil sie öfter abgerufen wird.

Wie beschleunigt man die Erfassung neuer Seiten?

Durch eine aktuelle XML-Sitemap, interne Verweise von bereits bekannten Seiten und — bei einzelnen wichtigen Adressen — die manuelle Prüfung in der Search Console. Wirksam ist vor allem die interne Verlinkung: Eine Seite, die von keiner anderen aus erreichbar ist, bleibt schwer auffindbar.

Verbrauchen KI-Crawler Serverressourcen?

Ja, teilweise erheblich. Mehrere Anbieter rufen dieselben Inhalte unabhängig voneinander ab. Bei auffälliger Last lohnt der Blick ins Logfile — und die Prüfung, ob die abrufende IP-Adresse tatsächlich zum angegebenen Kennzeichen gehört.

Verwandte Begriffe