SEO
Probleme mit der XML-Sitemap diagnostizieren – Schritt für Schritt
Eine Sitemap sollte eine saubere Liste der Seiten sein, die indexiert werden sollen. So prüfen Sie, ob Ihre Sitemap lädt, sich parsen lässt und nur erreichbare, indexierbare URLs enthält – und wie Sie sie korrigieren, wenn nicht.
Auf dieser Seite
Eine XML-Sitemap ist eine Liste der URLs, die Suchmaschinen crawlen und indexieren sollen. Sie garantiert keine Indexierung. Eine saubere Sitemap hilft Suchmaschinen aber, neue und aktualisierte Seiten zu finden, während eine unordentliche ihre Aufmerksamkeit an Weiterleitungen, Fehler und Seiten verschwendet, die Sie ausdrücklich von der Indexierung ausgenommen haben. Wenn Ihnen die Datei selbst noch neu ist, beginnen Sie mit robots.txt und sitemap.xml erklärt.
Sitemap-Probleme lassen sich in zwei Gruppen einteilen: die Datei selbst (lässt sie sich finden und lesen?) und ihr Inhalt (lohnt es sich, die enthaltenen URLs aufzuführen?). Prüfen Sie beides in dieser Reihenfolge.
Teil 1: Lässt sich die Sitemap finden und lesen?
Liegt sie dort, wo Suchmaschinen nachsehen?
Einen einzigen vorgeschriebenen Speicherort gibt es nicht. Sorgen Sie also dafür, dass die Sitemap auffindbar ist. Ergänzen Sie in Ihrer robots.txt eine Zeile mit absoluter URL, Sitemap: https://example.com/sitemap.xml, und reichen Sie die Sitemap in der Google Search Console und in den Bing Webmaster Tools ein. Viele Plattformen erzeugen sie unter /sitemap.xml, /sitemap_index.xml oder /wp-sitemap.xml.
Liefert sie 200 mit XML?
Öffnen Sie die Sitemap-URL im Browser und prüfen Sie den Status in den Entwicklertools. Häufige Fehlerbilder: ein 404 nach einer Plugin-Änderung, eine Weiterleitung auf die Startseite, eine Login-Seite oder ein „Soft“-Fehler – eine Antwort mit Status 200, die in Wahrheit eine HTML-Fehlerseite ist. Die Antwort sollte XML sein (application/xml oder text/xml), bei .xml.gz-Dateien gzip-komprimiertes XML.
Lässt sie sich parsen?
Das Wurzelelement muss <urlset> (eine Liste von Seiten) oder <sitemapindex> (eine Liste weiterer Sitemaps) sein. Die üblichen Verdächtigen sind Leerzeichen oder PHP-Warnungen vor der <?xml-Deklaration, nicht maskierte &-Zeichen in URLs (sie müssen als & geschrieben werden) und eine Ausgabe, die wegen eines Timeouts abgeschnitten wurde. Zeigt der Browser einen „XML-Verarbeitungsfehler“ an, sagt er Ihnen genau, wo Sie nachsehen müssen.
Hält sie die Grenzen ein?
Eine Sitemap-Datei darf höchstens 50.000 URLs enthalten und unkomprimiert höchstens 50 MB groß sein. Größere Websites verteilen ihre URLs auf mehrere Dateien und führen diese in einem Sitemap-Index auf. Achten Sie darauf, dass auch jede untergeordnete Sitemap lädt, die der Index nennt.
Teil 2: Sind die richtigen URLs aufgeführt?
Jede URL in Ihrer Sitemap sollte die endgültige, kanonische, indexierbare Adresse einer Seite sein, die 200 liefert. Alles andere sendet widersprüchliche Signale. Achten Sie auf:
- URLs, die 404, 410 oder 5xx liefern. Gelöschte Seiten, die in einer statischen Sitemap stehen geblieben sind, oder Produkte, die nicht mehr vorrätig waren und entfernt wurden.
- URLs, die weiterleiten. Oft die alte Form einer URL nach einer Migration oder die Variante mit
http://bzw. ohnewww. Führen Sie stattdessen das Ziel auf. - noindex-Seiten. Eine Seite aufzuführen und Suchmaschinen zugleich anzuweisen, sie nicht zu indexieren, ist ein Widerspruch in sich. Mehr dazu unter Was bedeutet noindex?.
- Nicht kanonische URLs. Parameter-Varianten oder Duplikate, deren Canonical woandershin zeigt. Mehr dazu unter Canonical-Probleme beheben.
- Fremde Hosts. Eine Sitemap darf nur URLs ihres eigenen Hosts aufführen, sofern Sie die websiteübergreifende Einreichung nicht verifiziert haben. Staging- oder CDN-Hostnamen sind ein klassisches Leck.
- Duplikate. Dieselbe URL doppelt aufgeführt, oft einmal mit und einmal ohne abschließenden Schrägstrich.
- Per robots.txt gesperrte URLs. Suchmaschinen können nicht crawlen, was Sie per Disallow ausgeschlossen haben. Es aufzuführen ist also sinnlos.
lastmod-Datumsangaben
<lastmod> sollte das W3C-Datetime-Format verwenden, etwa 2026-09-24 oder 2026-09-24T10:30:00+00:00, und die letzte wesentliche Änderung der Seite wiedergeben. Google nutzt lastmod nach eigenen Angaben, wenn der Wert durchgehend stimmt, und ignoriert priority und changefreq. Eine Sitemap, die bei jedem Build jede URL mit dem heutigen Datum versieht, bringt Suchmaschinen bei, das Feld zu ignorieren.
Prüfen Sie Ihre robots.txt und Ihre Sitemap
Der kostenlose SEO-Checker von Rudra ruft Ihre robots.txt und die dort angegebenen Sitemaps ab und meldet, ob sie laden und sich parsen lassen, ob sie die getestete Seite aufführen und ob sie gültige lastmod-Angaben enthalten.
So prüfen Sie es mit Rudra
Der SEO-Checker für einzelne Seiten
Der kostenlose SEO-Checker von Rudra liest Ihre robots.txt und die dort angegebenen Sitemaps (bis zu drei, wobei er einem Sitemap-Index zu dessen ersten untergeordneten Sitemaps folgt) und weicht auf gängige Speicherorte aus, wenn keine angegeben ist. Er meldet Sitemaps, die nicht erreichbar sind, sich nicht parsen lassen, die getestete Seite nicht aufführen oder keine lastmod-Angaben enthalten. Hinzu kommen informative Hinweise zu mehrfach aufgeführten URLs, URLs auf fremden Hosts und lastmod-Werten, die keine gültigen Datumsangaben sind. Außerdem meldet er Syntaxprobleme in der robots.txt und eine Regel, die die gesamte Website sperrt.
Ein Website-Scan
Ob die aufgeführten URLs tatsächlich funktionieren, lässt sich nur klären, indem man sie aufruft. Ein Website-Scan von Rudra (kostenloses Konto, Start über Ihr Dashboard) erfasst die URLs in Ihrer Sitemap und vergleicht sie mit dem, was der Crawl unter der jeweiligen Adresse vorgefunden hat: Sitemap-URLs, die 4xx oder 5xx geliefert haben, URLs mit noindex, URLs mit Weiterleitung und URLs auf fremden Hosts. URLs, die der Crawl wegen des Seitenlimits Ihres Tarifs oder wegen Robots-Regeln nicht erreicht hat, werden als „nicht gecrawlt“ gezählt und nicht als defekt gemeldet. Ein kleiner Crawl einer großen Sitemap zeigt also viele davon, und das ist so vorgesehen.
Search Console
Der Bericht „Sitemaps“ zeigt, ob Google jede Datei lesen konnte und wie viele URLs es darin gefunden hat. Der Bericht „Seitenindexierung“, nach einer Sitemap gefiltert, verrät Ihnen, welche der aufgeführten URLs nicht indexiert sind und warum.
Die häufigsten Ursachen beheben
- Lassen Sie die Sitemap von Ihrem CMS oder Framework erzeugen, statt sie von Hand zu pflegen, damit gelöschte und zurückgezogene Seiten automatisch herausfallen.
- Schließen Sie Seiten mit noindex, mit Weiterleitung und mit einem Canonical auf eine andere URL aus – in den Einstellungen Ihres SEO-Plugins oder Sitemap-Generators.
- Verwenden Sie überall Ihre bevorzugte URL-Form – Protokoll, Host und abschließender Schrägstrich –, damit Sitemap, Canonicals und interne Links übereinstimmen.
- Aktualisieren Sie lastmod nur, wenn sich der Inhalt ändert.
- Reichen Sie die Sitemap nach großen Änderungen neu ein, etwa nach einer Migration, und behalten Sie den Bericht „Sitemaps“ auf Lesefehler im Blick.
Häufig gestellte Fragen
Brauche ich eine Sitemap?
Kleine, gut verlinkte Websites lassen sich auch ohne problemlos crawlen. Am meisten hilft eine Sitemap großen Websites, neuen Websites, auf die erst wenige Links verweisen, und Websites, die häufig Seiten hinzufügen oder aktualisieren.
Wird eine Seite indexiert, wenn ich sie in meiner Sitemap aufführe?
Nein. Eine Sitemap hilft Suchmaschinen, URLs zu entdecken. Ob sie eine Seite indexieren, hängt von deren Qualität, von Duplikaten und von Signalen wie noindex oder Canonical-Tags ab.
Gehören Bilder oder PDFs in meine Sitemap?
Sie können sie aufführen, und es gibt Sitemap-Erweiterungen für Bilder. Vorrang hat aber, dass jede wichtige HTML-Seite mit ihrer kanonischen URL aufgeführt ist.
Warum meldet der Website-Scan, dass viele Sitemap-URLs nicht gecrawlt wurden?
Der Crawl endet am Seitenlimit Ihres Tarifs und beachtet die robots.txt. Er erreicht daher möglicherweise nicht jede URL, die Ihre Sitemap aufführt. Diese URLs gelten nicht als defekt – sie wurden in diesem Crawl lediglich nicht überprüft.