Rudra Analyzer

SEO

Comment diagnostiquer les problèmes de sitemap XML, étape par étape

Un sitemap doit être une liste propre des pages que vous souhaitez voir indexées. Comment vérifier que le vôtre se charge, s'analyse correctement et ne liste que des URL en ligne et indexables, et comment le corriger dans le cas contraire.

Par Rudra Techno Team 7 min de lecture
Sur cette page

Un sitemap XML est la liste des URL que vous aimeriez voir explorées et indexées par les moteurs de recherche. Il ne garantit pas l'indexation, mais un sitemap propre aide les moteurs à trouver les pages nouvelles et mises à jour, alors qu'un sitemap désordonné gaspille leur attention sur des redirections, des erreurs et des pages que vous leur avez demandé de ne pas indexer. Si le fichier lui-même vous est encore peu familier, commencez par robots.txt et sitemap.xml expliqués.

Les problèmes de sitemap se répartissent en deux groupes : le fichier lui-même (peut-il être trouvé et lu ?) et son contenu (les URL qu'il contient méritent-elles d'y figurer ?). Vérifiez-les dans cet ordre.

Partie 1 : le sitemap peut-il être trouvé et lu ?

Se trouve-t-il là où les moteurs de recherche le cherchent ?

Aucun emplacement unique n'est imposé : faites donc en sorte qu'il soit facile à découvrir. Ajoutez à votre robots.txt une ligne absolue Sitemap: https://example.com/sitemap.xml, et soumettez le sitemap dans Google Search Console et Bing Webmaster Tools. De nombreuses plateformes en génèrent un à l'adresse /sitemap.xml, /sitemap_index.xml ou /wp-sitemap.xml.

Renvoie-t-il un code 200 avec du XML ?

Ouvrez l'URL du sitemap dans un navigateur et vérifiez le code de statut dans les outils de développement. Les échecs fréquents : un 404 après un changement d'extension, une redirection vers la page d'accueil, une page de connexion, ou une « fausse » réussite, c'est-à-dire une réponse 200 qui est en réalité une page d'erreur HTML. La réponse doit être du XML (application/xml ou text/xml), ou du XML compressé en gzip pour les fichiers .xml.gz.

Est-il analysable ?

L'élément racine doit être <urlset> (une liste de pages) ou <sitemapindex> (une liste d'autres sitemaps). Des espaces parasites ou des avertissements PHP avant la déclaration <?xml, des caractères & non échappés dans les URL (ils doivent s'écrire &amp;) et une sortie tronquée par un délai d'expiration sont les coupables habituels. Un navigateur qui affiche « Erreur d'analyse XML » vous indique précisément où regarder.

Respecte-t-il les limites ?

Un fichier sitemap peut contenir au maximum 50 000 URL et peser 50 Mo non compressé. Les sites plus volumineux répartissent leurs URL sur plusieurs fichiers et les répertorient dans un index de sitemaps. Assurez-vous que chaque sitemap enfant cité dans l'index se charge lui aussi.

Partie 2 : les bonnes URL y figurent-elles ?

Chaque URL de votre sitemap doit être l'adresse finale, canonique et indexable d'une page qui renvoie un code 200. Tout le reste envoie un message contradictoire. Recherchez :

  • Les URL qui renvoient un 404, un 410 ou une erreur 5xx. Des pages supprimées restées dans un sitemap statique, ou des produits en rupture de stock qui ont été retirés.
  • Les URL qui redirigent. Souvent l'ancienne forme d'une URL après une migration, ou la version en http:// ou sans www. Indiquez plutôt la destination.
  • Les pages en noindex. Lister une page tout en demandant aux moteurs de recherche de ne pas l'indexer est contradictoire. Voir ce que signifie noindex.
  • Les URL non canoniques. Des versions avec paramètres ou des doublons dont la balise canonique pointe ailleurs. Pour aller plus loin : comment corriger les problèmes de balise canonique.
  • Les autres hôtes. Un sitemap ne peut lister que des URL de son propre hôte, sauf si vous avez validé l'envoi intersites ; les noms d'hôte de préproduction ou de CDN sont une fuite classique.
  • Les doublons. La même URL listée deux fois, souvent avec et sans barre oblique finale.
  • Les URL bloquées par robots.txt. Les moteurs de recherche ne peuvent pas explorer ce que vous avez interdit : le lister ne sert donc à rien.

Les dates lastmod

<lastmod> doit respecter le format W3C Datetime, comme 2026-09-24 ou 2026-09-24T10:30:00+00:00, et refléter la dernière modification significative de la page. Google indique qu'il tient compte de lastmod lorsque la valeur est systématiquement exacte, et qu'il ignore priority et changefreq. Un sitemap qui appose la date du jour sur toutes les URL à chaque build apprend aux moteurs de recherche à ignorer ce champ.

Vérifiez votre robots.txt et votre sitemap

L'outil d'analyse SEO gratuit de Rudra récupère votre robots.txt et les sitemaps déclarés, puis indique s'ils se chargent et s'analysent correctement, s'ils listent la page testée et s'ils comportent des dates lastmod valides.

Analyse votre page d’accueil · Gratuit · Sans inscription

Comment le vérifier avec Rudra

L'outil d'analyse SEO sur une seule page

L'outil d'analyse SEO gratuit de Rudra lit votre robots.txt et les sitemaps qu'il déclare (jusqu'à trois, en suivant un index de sitemaps jusqu'à ses premiers sitemaps enfants), et se rabat sur les emplacements courants lorsqu'aucun n'est déclaré. Il signale les sitemaps inaccessibles, impossibles à analyser, qui ne listent pas la page testée ou qui n'ont pas de dates lastmod, et ajoute des remarques informatives sur les URL répétées, les URL situées sur d'autres hôtes et les valeurs lastmod qui ne sont pas des dates valides. Il relève aussi les problèmes de syntaxe du robots.txt et la présence d'une règle qui bloque tout le site.

Une analyse de site

Pour savoir si les URL listées fonctionnent vraiment, il n'y a qu'un moyen : les visiter. Une analyse de site Rudra (compte gratuit, lancée depuis votre tableau de bord) relève les URL de votre sitemap et les compare à ce que le crawl a trouvé à chaque adresse : URL du sitemap ayant renvoyé une erreur 4xx ou 5xx, URL marquées noindex, URL redirigées et URL situées sur d'autres hôtes. Les URL que le crawl n'a pas atteintes, en raison de la limite de pages de votre offre ou des règles robots, sont comptées comme « non explorées » au lieu d'être signalées comme défaillantes ; un petit crawl sur un grand sitemap en affichera donc beaucoup, et c'est normal.

Search Console

Le rapport « Sitemaps » indique si Google a pu lire chaque fichier et combien d'URL il y a découvertes. Le rapport « Indexation des pages », filtré sur un sitemap, vous dit quelles URL listées ne sont pas indexées, et pourquoi.

Corriger les causes courantes

  1. Générez le sitemap depuis votre CMS ou votre framework, et non à la main, afin que les pages supprimées ou dépubliées en sortent automatiquement.
  2. Excluez les pages en noindex, redirigées ou dont la balise canonique pointe ailleurs dans les réglages de votre extension SEO ou de votre générateur de sitemap.
  3. Utilisez partout votre forme d'URL de référence (protocole, hôte et barre oblique finale), pour que le sitemap, les balises canoniques et les liens internes concordent.
  4. Ne mettez lastmod à jour que lorsque le contenu change.
  5. Soumettez-le de nouveau après les gros changements, une migration par exemple, et surveillez les erreurs de lecture dans le rapport « Sitemaps ».

Questions fréquentes

Ai-je besoin d'un sitemap ?

Les petits sites bien maillés peuvent être explorés sans difficulté sans sitemap. Celui-ci est surtout utile aux grands sites, aux sites récents vers lesquels pointent peu de liens et aux sites qui ajoutent ou mettent à jour souvent des pages.

Lister une page dans mon sitemap suffit-il à la faire indexer ?

Non. Un sitemap aide les moteurs de recherche à découvrir des URL ; l'indexation d'une page dépend de sa qualité, de la duplication et de signaux comme noindex ou les balises canoniques.

Les images ou les PDF doivent-ils figurer dans mon sitemap ?

Vous pouvez les y lister, et il existe des extensions de sitemap pour les images, mais la priorité est que chaque page HTML importante y figure avec son URL canonique.

Pourquoi l'analyse de site indique-t-elle que de nombreuses URL du sitemap n'ont pas été explorées ?

Le crawl s'arrête à la limite de pages de votre offre et respecte robots.txt : il peut donc ne pas atteindre toutes les URL que liste votre sitemap. Ces URL ne sont pas considérées comme défaillantes ; elles n'ont simplement pas été vérifiées lors de ce crawl.

Besoin d’une analyse plus poussée de votre site ?

Voyez tous les problèmes de votre site, classés par ordre de priorité

Vérifiez gratuitement n’importe quelle page, sans compte, ou inscrivez-vous pour explorer tout votre site. Chaque rapport couvre le SEO, les problèmes de performance courants, l’accessibilité et la sécurité, avec une correction suggérée pour chaque problème.