🤖 Technical SEO

Crawling & Indexierung – Wie Google Ihre Website liest

Wenn Google Ihre Seiten nicht findet oder nicht indexiert, nützen alle anderen SEO-Maßnahmen nichts. Verstehen Sie, wie Googles Crawler funktionieren, und optimieren Sie Crawling und Indexierung für maximale Sichtbarkeit.

Wie Googles Crawler funktionieren

Googles Webcrawler (Googlebot) entdeckt, crawlt und indexiert Webseiten in einem dreistufigen Prozess. Das Verständnis dieses Prozesses ist die Grundlage für effektives Technical SEO.

1. Entdecken (Discovery)

Googlebot findet neue URLs durch: Folgen von Links auf bekannten Seiten, Sitemaps, URL-Submissions in der Search Console und externe Backlinks.

2. Crawlen

Googlebot lädt den Inhalt der URL herunter und verarbeitet HTML, CSS und JavaScript. Dabei werden neue Links entdeckt und in die Crawl-Queue aufgenommen.

3. Indexieren

Gecrawlter Content wird analysiert, mit anderen Seiten verglichen und in Googles Index aufgenommen – wenn er als wertvoll und einzigartig bewertet wird.

robots.txt – Crawler steuern

Was ist robots.txt?

Die robots.txt ist eine Textdatei im Root-Verzeichnis Ihrer Website, die Crawlern mitteilt, welche Bereiche sie crawlen dürfen und welche nicht. Sie ist eine Empfehlung, keine Sperre – wichtige Seiten sollten über noindex-Tags geschützt werden.

User-agent: *
Disallow: /admin/
Disallow: /wp-login.php
Allow: /wp-content/uploads/
Sitemap: https://example.com/sitemap.xml

Häufige robots.txt Fehler

  • Gesamte Website blockiert (Disallow: /)
  • CSS und JS blockiert – verhindert korrektes Rendering
  • Noindex-Seiten trotzdem crawlen lassen (verschwendet Crawl-Budget)
  • Sitemap-URL nicht angegeben
  • Wichtige Kategorien versehentlich geblockt
  • Keine Unterscheidung zwischen User-Agents

sitemap.xml – Navigation für Crawler

Warum eine Sitemap wichtig ist

Eine XML-Sitemap ist eine strukturierte Liste aller wichtigen URLs Ihrer Website. Sie hilft Googlebot, alle relevanten Seiten zu entdecken – besonders wichtig bei großen Websites, tief verschachtelten Strukturen oder wenig verlinkten Seiten.

  • Alle wichtigen URLs enthalten
  • Nur indexierbare URLs (kein noindex)
  • Aktuelle lastmod-Daten
  • Sitemap-Index für große Websites
  • In Search Console einreichen

Sitemap-Typen

  • XML-Sitemap: Standard für alle Webseiten
  • Image Sitemap: Für Bild-SEO
  • Video Sitemap: Für Video-Content
  • News Sitemap: Für Google News
  • Sitemap-Index: Bündelt mehrere Sitemaps

Crawl-Budget optimieren

Was ist Crawl-Budget?

Crawl-Budget ist die Anzahl der URLs, die Googlebot in einem bestimmten Zeitraum crawlt. Es wird durch Crawl-Kapazität (Servergeschwindigkeit) und Crawl-Nachfrage (wie oft Google crawlen will) bestimmt. Kleine Sites haben keine Crawl-Budget-Probleme, große Websites (1.000+ Seiten) schon.

Crawl-Budget verschwenden

  • Session IDs in URLs
  • Facetten-Navigation ohne Canonicals
  • Duplizierter Content
  • Endlose Pagination
  • Broken Links (404-Seiten)
  • Redirect-Chains

Crawl-Budget sparen

  • Noindex für unwichtige Seiten
  • Canonicals für Duplikate
  • Facetten-Navigation begrenzen
  • Servergeschwindigkeit optimieren
  • Sitemap aktuell halten
  • Interne Links optimieren

Indexierungsprobleme erkennen und beheben

Seite gecrawlt, aber nicht indexiert

Häufige Ursachen: Thin Content, duplizierter Inhalt, noindex-Tag aktiv, Canonical auf andere URL, zu viele ähnliche Seiten, Content hinter Login. Lösung: Content deutlich aufwerten, unnötige Seiten konsolidieren oder noindex setzen.

Seite entdeckt, aber nicht gecrawlt

Ursachen: robots.txt blockiert, Server zu langsam, Crawl-Budget erschöpft. Lösung: robots.txt prüfen, Serverperformance verbessern, Link-Equity durch interne Verlinkung erhöhen.

Wichtige Seiten nicht indexiert

Ursachen: Seite zu tief in Seitenarchitektur (> 3 Klicks von Homepage), keine internen Links, kein Eintrag in Sitemap. Lösung: URL-Struktur flacher gestalten, interne Verlinkung verbessern, Sitemap aktualisieren.

Crawling-Probleme professionell lösen

Indexierungsprobleme sind einer der häufigsten Gründe für schlechte SEO-Performance. Lassen Sie uns Ihre Crawling-Situation analysieren.

Technical SEO Audit anfragen →

Häufige Fragen zu Crawling & Indexierung

Wie lange dauert es, bis Google eine neue Seite indexiert?

Das variiert stark: Bekannte, gut verlinkte Websites werden in Stunden bis Tagen gecrawlt. Neue Websites oder schwach verlinkte Seiten können Wochen bis Monate warten. Beschleunigen Sie den Prozess durch: URL-Einreichung in der Search Console, interne Verlinkung von wichtigen Seiten, und Sitemap-Einreichung.

Kann ich Google zwingen, meine Seite zu indexieren?

Nicht direkt. Sie können über die Google Search Console eine Indexierungsanfrage senden ("URL Inspection Tool" > "Indexierung beantragen"). Dies beschleunigt den Prozess, gibt aber keine Garantie. Google entscheidet autonom, welche Seiten indexiert werden.

Was bedeutet "gecrawlt – aktuell nicht indexiert"?

Google hat die Seite gecrawlt, sie aber nicht als indexierungswürdig eingestuft. Häufige Gründe: zu wenig einzigartiger Inhalt (Thin Content), stark ähnliche Seiten bereits indexiert, schlechte Nutzersignale oder fehlendes E-E-A-T. Lösung: Content deutlich aufwerten oder Seite mit Noindex versehen.

Soll ich noindex auf Seiten setzen, die ich nicht ranken will?

Ja, für Seiten ohne SEO-Wert: Danke-Seiten, Login-Seiten, interne Suchseiten, gefilterte Kategorieseiten (E-Commerce), duplizierte Inhalte. Noindex spart Crawl-Budget für wichtige Seiten. Aber: Noindex nicht auf Seiten mit eingehenden Backlinks setzen – diese Backlink-Power geht verloren.

Wie prüfe ich, ob meine Seite von Google indexiert wurde?

Methoden: Google-Suche mit "site:ihre-domain.de/ihre-seite", URL Inspection Tool in der Search Console (zeigt genauesten Status), oder Google Search Console Coverage-Report. Die Search Console ist die zuverlässigste Methode, da sie direkte Daten von Google liefert.

Warum werden manche meiner Seiten aus dem Index entfernt?

Gründe für Deindexierung: Google wertet den Content als Thin Content neu, manuelle Penalty, automatischer Spam-Schutz wurde ausgelöst, Canonical zeigt auf andere URL, technische Probleme (Server-Fehler, robots.txt-Änderung). Prüfen Sie den Coverage-Bericht in der Search Console für Details.

Was ist Mobile-First-Indexierung und was bedeutet sie?

Google indexiert und bewertet Websites primär anhand ihrer mobilen Version (Googlebot Smartphone). Websites, die mobile weniger Inhalt zeigen als Desktop, verlieren in der Indexierung. Stellen Sie sicher: gleicher Content auf Mobile und Desktop, kein wichtiger Content hinter Tabs oder Accordions verborgen, responsive Design implementiert.

Wie oft crawlt Google meine Website?

Die Crawl-Frequenz hängt ab von: Website-Größe und -Popularität, Update-Häufigkeit des Contents, Server-Geschwindigkeit und PageRank der Seiten. Beliebte, häufig aktualisierte Websites werden täglich gecrawlt, kleine wenig verlinkte Websites vielleicht nur wöchentlich oder monatlich. Regelmäßige Content-Updates erhöhen die Crawl-Frequenz.