SEO
robots.txt und sitemap.xml erklärt – mit Beispielen
Zwei kleine Dateien im Stammverzeichnis Ihrer Website sagen Crawlern, wohin sie dürfen und welche Seiten gefunden werden sollen. So funktionieren beide – mit Beispielen.
Auf dieser Seite
Zwei schlichte Dateien im Stammverzeichnis Ihrer Website erleichtern Suchmaschinen die Arbeit. Die robots.txt teilt Crawlern mit, welche Bereiche der Website sie crawlen dürfen und welche nicht. Die sitemap.xml listet die Seiten auf, die gefunden werden sollen. Beide ergänzen sich gut, doch keine von ihnen garantiert, dass eine Seite indexiert wird oder den Suchergebnissen fernbleibt – und genau dieses Missverständnis steckt hinter den meisten der unten beschriebenen Probleme.
Was die robots.txt bewirkt
Die robots.txt ist eine reine Textdatei, die im Stammverzeichnis eines Hosts liegen muss, zum Beispiel unter https://example.com/robots.txt. Sie gilt nur für genau dieses Protokoll und diesen Host – shop.example.com braucht also eine eigene Datei. Crawler, die sich an das Robots Exclusion Protocol halten, darunter Googlebot und Bingbot, lesen sie vor dem Crawlen und befolgen ihre Regeln.
Sie ist eine Sammlung von Bitten, kein Sicherheitsmechanismus. Bots, die sich nicht an die Regeln halten, können sie ignorieren, und die Datei selbst ist öffentlich: Wer einen „geheimen“ Ordner darin aufführt, macht in Wahrheit Werbung für ihn. Schützen Sie private Inhalte durch eine Authentifizierung.
Eine einfache robots.txt
User-agent: *Disallow: /admin/Disallow: /cartDisallow: /searchSitemap: https://example.com/sitemap.xml
Zeile für Zeile: Die Regeln gelten für jeden Crawler (*); nichts unterhalb von /admin/ und keine URL, die mit /cart oder /search beginnt, soll gecrawlt werden; und die Sitemap liegt unter der angegebenen Adresse. Die Sitemap-Zeile muss eine vollständige URL enthalten und gilt unabhängig davon, in welcher User-Agent-Gruppe sie steht.
Wie die Regeln gelesen werden
- Regeln greifen am Anfang des URL-Pfads und unterscheiden zwischen Groß- und Kleinschreibung:
Disallow: /Adminsperrt/adminnicht. - Google unterstützt zwei Platzhalter:
*für eine beliebige Zeichenfolge und$für das Ende der URL.Disallow: /*.pdf$sperrt URLs, die auf.pdfenden. - Widersprechen sich
Allow- undDisallow-Regeln, folgt Google der spezifischsten (längsten) passenden Regel; bei Gleichstand gewinntAllow. - Ein Crawler befolgt nur die spezifischste Gruppe, die ihn nennt. Gibt es eine Gruppe
User-agent: Googlebot, ignoriert der Googlebot die GruppeUser-agent: *vollständig – wiederholen Sie gemeinsame Regeln also dort. Disallow: /sperrt die gesamte Website. Ein leeresDisallow:sperrt nichts.
Crawling zu sperren heißt nicht, die Indexierung zu sperren
Das ist der wichtigste Punkt bei der robots.txt. Eine gesperrte URL kann trotzdem in den Suchergebnissen erscheinen, meist ohne Beschreibung, wenn andere Seiten auf sie verlinken: Google weiß, dass die URL existiert, hat sie aber nicht gelesen. Um eine Seite aus den Suchergebnissen herauszuhalten, lassen Sie das Crawlen zu und setzen Sie eine noindex-Anweisung – entweder <meta name="robots" content="noindex"> im HTML oder den Antwortheader X-Robots-Tag: noindex. Sperrt die robots.txt die Seite, bekommt Google das noindex nie zu sehen.
Regeln, die Google ignoriert
Google unterstützt noindex in der robots.txt nicht (die inoffizielle Regel wird seit 2019 nicht mehr beachtet) und ignoriert Crawl-delay. Bing hingegen beachtet Crawl-delay. Belastet der Googlebot Ihren Server zu stark, erhöhen Sie die Serverkapazität oder geben Sie im Notfall vorübergehend die Statuscodes 503 oder 429 zurück.
Was die sitemap.xml bewirkt
Eine XML-Sitemap ist eine Liste der URLs, die Suchmaschinen crawlen und indexieren sollen. Am wichtigsten ist sie für große Websites, für neue Websites mit wenigen Links von außen und für Seiten, die über interne Links schwer zu erreichen sind. Eine minimale Sitemap sieht so aus:
<?xml version="1.0" encoding="UTF-8"?><urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"><url><loc>https://example.com/</loc><lastmod>2026-09-20</lastmod></url><url><loc>https://example.com/pricing</loc><lastmod>2026-08-02</lastmod></url></urlset>
- Größenbeschränkungen: Jede Sitemap-Datei darf bis zu 50.000 URLs enthalten und unkomprimiert bis zu 50 MB groß sein. Größere Websites verteilen ihre URLs auf mehrere Sitemaps und führen diese in einer Sitemap-Indexdatei auf.
- lastmod: Google verwendet das Datum der letzten Änderung, wenn es durchgängig stimmt. Aktualisieren Sie es, wenn sich der Inhalt der Seite nennenswert ändert – nicht bei jedem Deployment.
- priority und changefreq: Google ignoriert beide, Feinjustierung lohnt sich also nicht.
- Nur URLs aufführen, die indexiert werden sollen: kanonische, indexierbare Seiten, die
200liefern. Lassen Sie Weiterleitungen, Fehlerseiten,noindex-Seiten und doppelte URLs mit Tracking-Parametern weg.
Sitemap erstellen und einreichen
Von Hand schreiben müssen Sie eine Sitemap nur selten. WordPress erzeugt seit Version 5.5 eine einfache Sitemap unter /wp-sitemap.xml, und SEO-Plugins ersetzen sie durch ihre eigene; Shopify und die meisten gehosteten Baukästen legen /sitemap.xml automatisch an; in Next.js erzeugt eine Datei app/sitemap.ts die Sitemap. Sobald sie existiert, teilen Sie Suchmaschinen auf zwei Wegen mit, wo sie liegt: Ergänzen Sie in der robots.txt eine Sitemap:-Zeile und reichen Sie die Sitemap im Sitemaps-Bericht der Google Search Console (und in den Bing Webmaster Tools) ein. Die Search Console zeigt dann, ob sie gelesen werden konnte und wie viele ihrer URLs indexiert sind.
So prüfen Sie Ihre robots.txt und Ihre Sitemap
Öffnen Sie zunächst beide Dateien im Browser: /robots.txt und die Sitemap-URL. Prüfen Sie dann die Seite, um die es Ihnen geht, mit Rudras kostenlosem SEO-Checker. Er ruft Ihre robots.txt ab und meldet, ob sie die getestete Seite für den allgemeinen User-Agent * sperrt und ob sie eine Sitemap angibt. Anschließend sucht er die Sitemap (am angegebenen Ort, andernfalls unter /sitemap.xml und /sitemap_index.xml), prüft, ob sie sich als Sitemap oder Sitemap-Index parsen lässt, und meldet, ob die Einträge lastmod-Daten tragen und ob die getestete URL aufgeführt ist.
Googles eigene Sicht liefern der robots.txt-Bericht und die URL-Prüfung in der Search Console: Sie zeigen, ob eine bestimmte URL gesperrt und ob sie indexiert ist.
Häufige Fehler
- Mit der robots.txt der Staging-Umgebung live gehen. Ein aus der Entwicklung übrig gebliebenes
Disallow: /kann die gesamte Live-Website sperren. Prüfen Sie die robots.txt am Tag des Launchs. - CSS und JavaScript sperren, die Seiten zum Rendern benötigen – Google kann die Seite dann nicht so sehen wie Ihre Besucher.
- Mit der robots.txt Seiten aus Google entfernen wollen. Verwenden Sie
noindex(und lassen Sie das Crawlen der Seite zu) oder in dringenden Fällen das Tool zum Entfernen von URLs in der Search Console. - Eine robots.txt-Sperre mit noindex kombinieren – auf derselben Seite verhindert das, dass das
noindexüberhaupt gesehen wird. - Die falschen URLs in der Sitemap aufführen: Weiterleitungen, 404-Seiten,
noindex-Seiten,http://-Versionen oder eine andere Domain. - Bei jedem Build jedes lastmod-Datum auf heute setzen – damit werden die Daten für Suchmaschinen wertlos.
- Eine robots.txt, die einen Serverfehler liefert. Eine fehlende robots.txt (404) wertet Google als „alles crawlen“, ein 5xx-Fehler kann jedoch dazu führen, dass die Website nicht mehr gecrawlt wird, bis die Datei wieder erreichbar ist.
Häufig gestellte Fragen
Brauche ich eine robots.txt?
Nicht unbedingt. Wenn es nichts gibt, wovon Sie Crawler fernhalten möchten, können Sie darauf verzichten; eine robots.txt, die 404 liefert, bedeutet, dass alles gecrawlt werden darf. Viele Websites legen trotzdem eine an, um wenig wertvolle Bereiche wie interne Suchergebnisse zu sperren und auf die Sitemap zu verweisen.
Brauche ich eine XML-Sitemap?
Kleine Websites mit guter interner Verlinkung werden meist auch ohne gefunden. Eine Sitemap kostet aber wenig und hilft Suchmaschinen, neue und aktualisierte Seiten schneller zu entdecken. Am meisten profitieren große Websites, neue Websites und Websites mit tief liegenden oder schlecht verlinkten Seiten.
Wird eine Seite indexiert, wenn ich sie in die Sitemap aufnehme?
Nein. Eine Sitemap hilft Suchmaschinen, URLs zu entdecken. Ob eine Seite indexiert wird, hängt aber von ihrer Qualität ab, davon, ob sie andere Seiten dupliziert, und davon, ob sie gecrawlt werden kann und nicht mit noindex markiert ist.
Wie sperre ich KI-Crawler mit der robots.txt aus?
Legen Sie für jeden Crawler, den Sie aussperren möchten, eine User-Agent-Gruppe mit Disallow: / an, etwa für GPTBot (OpenAI) oder CCBot (Common Crawl). Google-Extended steuert, ob Google Ihre Inhalte für seine KI-Modelle verwenden darf, ohne dass sich das auf die Google-Suche auswirkt. Diese Regeln wirken nur bei Crawlern, die die robots.txt freiwillig respektieren.
Wo müssen robots.txt und sitemap.xml liegen?
Die robots.txt muss im Stammverzeichnis jedes Hosts liegen, etwa unter https://example.com/robots.txt. Eine Sitemap kann überall auf dem Host liegen, üblich ist aber /sitemap.xml; geben Sie ihren Ort in der robots.txt an und reichen Sie sie in der Google Search Console ein.