
Sie suchen eine präzise Information auf einer Website, aber sie bleibt nach mehreren Klicks unauffindbar. Das Hauptmenü listet nur eine Handvoll Kategorien, und der restliche Inhalt scheint irgendwo vergraben zu sein. Alle Seiten einer Website zu erkunden erfordert keine fortgeschrittenen technischen Fähigkeiten, solange man weiß, wo man suchen und welche Werkzeuge man einsetzen kann.
Die Sitemap-Datei, eine Karte, die von Besuchern selten konsultiert wird
Jede gut gestaltete Website verfügt über eine Datei namens sitemap. Diese XML-Datei listet alle Seiten auf, die der Eigentümer der Website für Suchmaschinen zugänglich machen möchte. Sie funktioniert wie ein umfassendes Inhaltsverzeichnis, das viel vollständiger ist als das sichtbare Navigationsmenü.
Um darauf zuzugreifen, fügen Sie einfach /sitemap.xml am Ende der Website-Adresse hinzu. Zum Beispiel, wenn die Adresse einer Website beispiel.de ist, geben Sie beispiel.de/sitemap.xml in Ihren Browser ein. Sie erhalten eine rohe Liste von URLs, die manchmal in mehrere thematische Unter-Sitemaps organisiert ist.
Ein noch direkterer Reflex besteht darin, die robots.txt-Datei der Website zu konsultieren (indem Sie /robots.txt nach dem Domainnamen eingeben). Diese Datei gibt oft den genauen Standort der Sitemaps an, einschließlich von verschachtelten Sitemaps, die Sie sonst nicht finden würden. Das ist übrigens der beste Ausgangspunkt für eine umfassende Erkundung, da sie URLs offenbart, die eine einfache Google-Suche nicht immer zurückgibt.
Lesetipp : So gelangen Sie 2026 einfach zu 1jour1film: umfassender Leitfaden und Tipps
Um alle Seiten von Excargot zu entdecken, bietet dieser Ansatz über die Sitemap einen sofortigen Überblick über die gesamte Struktur der Website und ihre verschiedenen Kategorien.

Operator site: in Google, um indexierte Seiten zu filtern
Haben Sie schon einmal bemerkt, dass Google manchmal eine Website besser kennt als deren eigener Besitzer? Der Suchoperator site: ermöglicht es, alle Seiten aufzulisten, die eine Suchmaschine für eine bestimmte Domain indexiert hat.
Geben Sie in Google ein: site:beispiel.de (ohne Leerzeichen nach dem Doppelpunkt). Die Ergebnisse zeigen jede indexierte Seite mit ihrem Titel und ihrer Beschreibung. Sie können die Suche verfeinern, indem Sie ein Schlüsselwort nach dem Befehl hinzufügen. Zum Beispiel wird site:beispiel.de rezept nur die Seiten anzeigen, die den Begriff “rezept” enthalten.
Diese Methode hat eine klare Grenze: Sie zeigt nur die indexierten Seiten. Seiten, die durch eine robots.txt-Datei blockiert, durch ein Passwort geschützt oder als “noindex” markiert sind, erscheinen nicht. Deshalb bleibt die Kombination dieser Technik mit der Sitemap der zuverlässigste Ansatz.
Struktur und interne Links, die Struktur einer Website lesen
Die Navigation einer Website basiert auf ihrer Struktur, also der hierarchischen Organisation ihrer Seiten und Kategorien. Das Verständnis dieser Struktur hilft, Inhalte zu finden, die im Hauptmenü nicht hervorgehoben werden.
Kategorien über die Fußzeile analysieren
Die Fußzeile (Footer) einer Website enthält oft Links zu sekundären Kategorien: rechtliche Hinweise, HTML-Sitemap, Seiten mit tiefen Kategorien. Bevor Sie ein externes Tool verwenden, scrollen Sie bis zum Ende der Seite. Viele Websites bieten einen HTML-Sitemap, der für Besucher zugänglich ist, der sich von der XML-Sitemap für Suchmaschinen unterscheidet.
Interne Links von Seite zu Seite verfolgen
Jede Seite einer Website enthält Links zu anderen Seiten derselben Website. Durch systematisches Klicken auf diese internen Links erkunden Sie die tatsächliche Struktur des Inhalts. Es ist eine manuelle Arbeit, aber sie ermöglicht es, verwaiste Seiten (ohne eingehende Links aus dem Menü) oder wenig sichtbare Kategorien zu erkennen.

Crawl-Tools zur tiefen Erkundung einer Website
Wenn eine Website Hunderte von Seiten hat, stößt die manuelle Erkundung schnell an ihre Grenzen. Crawl-Tools automatisieren diese Aufgabe, indem sie jeden internen Link durchlaufen, genau wie es ein Suchmaschinen-Roboter tun würde.
Diese modernen Tools kombinieren mehrere Ansätze gleichzeitig:
- Lesen der XML-Sitemap, um die vom Site-Besitzer deklarierten URLs zu sammeln
- Crawl der internen Links, um die tatsächlich über die Navigation zugänglichen Seiten zu entdecken
- JavaScript-Rendering, um dynamisch geladenen Inhalt zu erkennen, der bei einem einfachen HTTP-Load unsichtbar ist
Die integrierte Duplikatseliminierung entfernt Duplikate und erstellt eine flache und vollständige Liste aller URLs der Website. Zu den kostenlosen oder zugänglichen Lösungen gehören Screaming Frog (kostenlose, eingeschränkte Version) und die Crawlfunktionen der Google Search Console, die die meisten Bedürfnisse abdecken.
Ein Punkt der Vorsicht: die Regeln der robots.txt-Datei respektieren und die Crawling-Rate begrenzen. Ein zu aggressives Crawlen kann den Server der Ziel-Website überlasten oder Blockierungen auslösen. Seriöse Tools integrieren ein System zur automatischen Begrenzung der Anzahl der Anfragen pro Sekunde.
Quellen kombinieren, um fehlende Seiten zu erkennen
Keine einzelne Methode garantiert einen vollständigen Überblick über eine Website. Die effektivste Praxis besteht darin, mindestens drei Wahrheitsquellen zu kombinieren:
- Die offizielle Sitemap der Website (was der Eigentümer deklariert)
- Ein Crawl der internen Links (was tatsächlich zugänglich ist)
- Das Index der Suchmaschine über den Operator site: (was Google kennt)
Die Abweichungen zwischen diesen drei Listen offenbaren konkrete Situationen. Eine Seite, die in der Sitemap vorhanden, aber im Google-Index nicht aufgeführt ist, hat wahrscheinlich ein Indexierungsproblem. Eine Seite, die durch den Crawl gefunden, aber nicht in der Sitemap enthalten ist, ist eine vom Webmaster vergessene Seite. Eine von Google indexierte Seite, die über die interne Navigation nicht zugänglich ist, ist eine verwaiste Seite, die oft im Ranking benachteiligt wird.
Diese Listen zu vergleichen dauert mit einer Tabellenkalkulation nur wenige Minuten. Exportieren Sie jede Liste als CSV, fügen Sie sie zusammen und sortieren Sie nach Entdeckungsquelle. Die Zeilen, die nur in einer einzigen Spalte erscheinen, verdienen Ihre Aufmerksamkeit.
Die vollständige Erkundung einer Website besteht letztendlich darin, einfache Handlungen (Sitemap konsultieren, Operator site: verwenden, interne Links durchgehen) mit einem Crawl-Tool zu kombinieren, wenn das Seitenvolumen dies rechtfertigt. Die Kombination dieser Ansätze bleibt der einzige zuverlässige Weg, ein vollständiges Inventar ohne blinde Flecken zu erstellen.