Technisches SEO

Crawl-Budget

Das Crawl-Budget bezeichnet die Menge an Seiten, die eine Suchmaschine innerhalb eines Zeitraums auf einer Domain abruft. Es ergibt sich aus zwei Größen: dem, was der Server verkraftet, und dem, was die Domain aus Sicht der Suchmaschine wert ist.

Die erste Größe heißt Crawl-Kapazität und bemisst sich an Antwortzeiten und Fehlerquote. Wird der Server langsam oder liefert er Fehler, fährt die Suchmaschine die Abrufrate zurück, um ihn nicht zu belasten. Die zweite heißt Crawl-Bedarf und richtet sich nach Bekanntheit, Aktualität und Änderungshäufigkeit der Inhalte.

Für wen es überhaupt eine Rolle spielt

Für die meisten Websites: für keine. Google nennt in seiner Anleitung zum Crawl-Budget zwei Größenordnungen, ab denen sich die Beschäftigung damit lohnt: sehr große Bestände ab etwa einer Million Seiten mit wöchentlichen Änderungen, oder Bestände ab etwa 10.000 Seiten, deren Inhalte sich täglich ändern. Beides sind ausdrücklich Anhaltspunkte, keine Schwellen. Eine Unternehmensseite mit dreißig Seiten hat kein Crawl-Budget-Problem, sondern gegebenenfalls ein Inhaltsproblem.

Relevant wird das Thema in drei Lagen: bei sehr großen Beständen, bei Websites mit vielen automatisch erzeugten Adressen — und, oft übersehen, nach einem Sicherheitsvorfall. Wenn eine Kompromittierung zehntausende fremde Adressen erzeugt hat, kennt die Suchmaschine plötzlich ein Vielfaches der echten Seiten. Bis diese Geister aus dem Bestand verschwunden sind, erreicht die Erfassung neue, echte Inhalte nur verzögert.

Wo Budget verschwendet wird

  • Parameterkombinationen aus Filtern und Sortierungen, die beliebig viele Adressen mit fast gleichem Inhalt erzeugen.
  • Endlose Kalender und Blätterfunktionen ohne Abschluss.
  • Weiterleitungsketten — jeder Zwischenschritt ist ein eigener Abruf.
  • Soft-404: Seiten, die „nicht gefunden“ anzeigen, aber Status 200 melden und deshalb immer wieder besucht werden.
  • Reste alter Systeme, die nach einer Migration erreichbar geblieben sind.

Was tatsächlich hilft

Die wirksamste Maßnahme ist auch die unspektakulärste: weniger Adressen. Wo Seiten nicht existieren müssen, entfallen sie; wo Varianten unvermeidlich sind, wird über ein Canonical Tag zusammengeführt.

Daneben zählen eine korrekte, gepflegte XML-Sitemap, saubere Serverantworten ohne Ketten und ausreichende Servergeschwindigkeit. Ein Ausschluss in der robots.txt kann Abrufe verhindern, sollte aber gezielt und mit Bedacht eingesetzt werden — gesperrte Seiten können weder aus dem Index entfernt noch neu bewertet werden.

Was nicht hilft: Noindex als Sparmaßnahme. Eine so gekennzeichnete Seite wird weiterhin abgerufen — die Anweisung muss ja gelesen werden.

Messung

Zwei Quellen geben Auskunft. Der Bericht zu den Crawling-Statistiken in der Search Console zeigt Abrufe pro Tag, Antwortzeiten und die Verteilung nach Statuscodes. Das Serverlogfile zeigt darüber hinaus, welche Adressen abgerufen wurden — und dort wird meist sichtbar, dass ein erheblicher Teil der Abrufe auf Seiten entfällt, die geschäftlich bedeutungslos sind.

Der aussagekräftigste Einzelwert ist das Verhältnis zwischen abgerufenen und tatsächlich vorhandenen Adressen. Liegt es weit über eins, existieren Seiten, die niemand angelegt hat.

Der Zusammenhang mit der Erreichbarkeit

Ein Punkt wird bei der Diskussion über Crawl-Budget regelmäßig übergangen: Die Kapazitätsseite hängt unmittelbar an der Servergeschwindigkeit. Wer die Antwortzeiten halbiert, verdoppelt näherungsweise die Zahl der Abrufe, die in derselben Zeit möglich sind — ohne dass an Inhalten oder Struktur etwas geändert würde.

Umgekehrt gilt dasselbe. Häufige Zeitüberschreitungen oder 5xx-Antworten führen dazu, dass die Abrufrate zurückgefahren wird, und diese Drosselung wirkt über die Störung hinaus. Ein Server, der unter Last unzuverlässig wird, kostet also doppelt: einmal bei den Besuchern und einmal bei der Erfassung.

Für die Praxis bedeutet das, dass Arbeit an Ladezeit und Stabilität nicht nur eine Frage der Nutzererfahrung ist. Sie ist zugleich die einzige Stellschraube am Crawl-Budget, die man selbst vollständig in der Hand hat — den Bedarf bestimmt die Suchmaschine, die Kapazität der Betreiber.

Häufige Fragen

Verbessert häufigeres Crawling das Ranking?

Nein. Die Abrufhäufigkeit ist eine Folge wahrgenommener Bedeutung, kein Bewertungsmerkmal. Eine Seite steigt nicht, weil sie öfter besucht wird.

Ab welcher Größe sollte man sich damit befassen?

Nach Googles Anhaltspunkten ab etwa einer Million Seiten bei wöchentlicher Änderung oder ab etwa 10.000 Seiten bei täglicher. Unabhängig davon lohnt die Prüfung immer dann, wenn die Zahl der bekannten Adressen die Zahl der echten Seiten deutlich übersteigt — dieser Fall tritt auch bei kleinen Websites ein, etwa nach einem Sicherheitsvorfall oder einer misslungenen Migration.

Verbrauchen KI-Crawler dasselbe Budget?

Nein, sie arbeiten unabhängig und haben eigene Abrufmuster. Sie belasten aber denselben Server, was mittelbar die Kapazität für Suchmaschinen-Crawler senken kann. Bei auffälliger Last lohnt der Blick ins Logfile.

Hilft es, die Sitemap häufiger einzureichen?

Nein. Eine erneute Einreichung derselben Datei beschleunigt nichts. Wirksam ist ein aktuelles lastmod-Datum, das tatsächliche Änderungen widerspiegelt — falsche Angaben dort werden nach kurzer Zeit ignoriert.

Verwandte Begriffe