Rudra Analyzer

SEO

robots.txt et sitemap.xml expliqués, exemples à l'appui

Deux petits fichiers à la racine de votre site indiquent aux robots où ils peuvent aller et quelles pages vous voulez faire découvrir. Voici comment chacun fonctionne, exemples à l'appui.

Par Rudra Techno Team 8 min de lecture
Sur cette page

Deux fichiers tout simples, placés à la racine de votre site web, facilitent le travail des moteurs de recherche. robots.txt indique aux robots d'exploration quelles parties du site ils peuvent explorer ou non. sitemap.xml dresse la liste des pages que vous souhaitez leur faire découvrir. Ils se complètent bien, mais aucun des deux ne garantit qu'une page sera indexée ou tenue à l'écart des résultats de recherche, et c'est de ce malentendu que naissent la plupart des problèmes décrits ci-dessous.

À quoi sert robots.txt

robots.txt est un fichier texte brut qui doit se trouver à la racine d'un hôte, par exemple https://example.com/robots.txt. Il ne s'applique qu'à ce protocole et à cet hôte précis : shop.example.com a donc besoin de son propre fichier. Les robots qui respectent le protocole d'exclusion des robots, dont Googlebot et Bingbot, le lisent avant d'explorer le site et en suivent les règles.

Il s'agit d'un ensemble de demandes, pas d'un dispositif de sécurité. Les robots malveillants peuvent l'ignorer, et le fichier lui-même est public : y inscrire un dossier « secret » revient donc à en faire la publicité. Protégez les contenus privés par une authentification.

Un robots.txt simple

  • User-agent: *
  • Disallow: /admin/
  • Disallow: /cart
  • Disallow: /search
  • Sitemap: https://example.com/sitemap.xml

Ligne par ligne : les règles s'appliquent à tous les robots (*) ; n'explorez rien sous /admin/, ni aucune URL commençant par /cart ou /search ; et le sitemap se trouve à l'adresse indiquée. La ligne Sitemap doit contenir une URL complète, et elle s'applique quel que soit le groupe user-agent dans lequel elle figure.

Comment les règles sont interprétées

  • Les règles sont comparées au début du chemin de l'URL et tiennent compte de la casse : Disallow: /Admin ne bloque pas /admin.
  • Google prend en charge deux caractères génériques : * pour une suite quelconque de caractères et $ pour la fin de l'URL. Disallow: /*.pdf$ bloque les URL qui se terminent par .pdf.
  • Lorsque des règles Allow et Disallow se contredisent, Google applique la règle correspondante la plus spécifique (la plus longue), et Allow l'emporte en cas d'égalité.
  • Un robot n'obéit qu'au groupe le plus spécifique qui le désigne. Si vous avez un groupe User-agent: Googlebot, Googlebot ignore complètement le groupe User-agent: * : répétez-y donc les règles communes.
  • Disallow: / bloque tout le site. Un Disallow: vide ne bloque rien.

Bloquer l'exploration n'est pas bloquer l'indexation

C'est le point le plus important à retenir sur robots.txt. Une URL interdite d'exploration peut tout de même apparaître dans les résultats de recherche, généralement sans description, si d'autres pages pointent vers elle : Google sait que l'URL existe, mais ne l'a pas lue. Pour tenir une page à l'écart des résultats, laissez-la être explorée et ajoutez une directive noindex, soit <meta name="robots" content="noindex"> dans le HTML, soit un en-tête de réponse X-Robots-Tag: noindex. Si robots.txt bloque la page, Google ne voit jamais le noindex.

Les règles que Google ignore

Google ne prend pas en charge noindex dans robots.txt (il a cessé de respecter cette règle non officielle en 2019) et ignore Crawl-delay. Bing, lui, respecte bien Crawl-delay. Si Googlebot sollicite trop votre serveur, augmentez la capacité de celui-ci ou, en cas d'urgence, renvoyez temporairement des réponses 503 ou 429.

À quoi sert sitemap.xml

Un sitemap XML est la liste des URL que vous aimeriez voir explorées et indexées par les moteurs de recherche. Il est surtout utile aux sites volumineux, aux sites récents qui reçoivent peu de liens de l'extérieur et aux pages difficiles à atteindre par les liens internes. Voici à quoi ressemble un sitemap minimal :

  • <?xml version="1.0" encoding="UTF-8"?>
  • <urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  • <url><loc>https://example.com/</loc><lastmod>2026-09-20</lastmod></url>
  • <url><loc>https://example.com/pricing</loc><lastmod>2026-08-02</lastmod></url>
  • </urlset>
  • Limites de taille : chaque fichier sitemap peut contenir jusqu'à 50 000 URL et peser jusqu'à 50 Mo non compressé. Les sites plus volumineux répartissent leurs URL sur plusieurs sitemaps et les référencent dans un fichier d'index de sitemaps.
  • lastmod : Google utilise la date de dernière modification si elle est exacte de façon constante. Mettez-la à jour lorsque le contenu de la page change de manière significative, pas à chaque déploiement.
  • priority et changefreq : Google ignore les deux, inutile donc de les peaufiner.
  • N'indiquez que les URL que vous voulez voir indexées : des pages canoniques et indexables qui renvoient un code 200. Laissez de côté les redirections, les pages d'erreur, les pages noindex et les URL en double dotées de paramètres de suivi.

Créer et soumettre un sitemap

Il est rare de devoir en écrire un à la main. WordPress génère un sitemap de base à l'adresse /wp-sitemap.xml depuis la version 5.5, et les extensions SEO le remplacent par le leur ; Shopify et la plupart des créateurs de sites hébergés créent /sitemap.xml automatiquement ; dans Next.js, un fichier app/sitemap.ts en génère un. Une fois le sitemap en place, indiquez son emplacement aux moteurs de recherche de deux façons : ajoutez une ligne Sitemap: dans robots.txt et soumettez-le dans le rapport Sitemaps de la Google Search Console (ainsi que dans Bing Webmaster Tools). La Search Console indique alors s'il a pu être lu et combien de ses URL sont indexées.

Comment vérifier votre robots.txt et votre sitemap

Commencez par ouvrir les deux fichiers dans votre navigateur : /robots.txt et l'URL du sitemap. Soumettez ensuite la page qui vous intéresse à l'outil gratuit de vérification SEO de Rudra. Il récupère votre robots.txt et indique s'il bloque la page testée pour le user-agent générique * et s'il déclare un sitemap. Il recherche ensuite le sitemap (à l'emplacement déclaré, sinon à /sitemap.xml et /sitemap_index.xml), vérifie qu'il s'analyse bien comme un sitemap ou un index de sitemaps, et indique si les entrées portent une date lastmod et si l'URL testée y figure.

Pour connaître le point de vue de Google, utilisez le rapport robots.txt et l'outil d'inspection d'URL de la Search Console, qui indiquent si une URL donnée est bloquée et si elle est indexée.

Les erreurs courantes

  • Mettre en ligne avec le robots.txt de préproduction. Un Disallow: / hérité du développement peut bloquer tout le site en production. Vérifiez robots.txt le jour du lancement.
  • Bloquer les fichiers CSS et JavaScript dont les pages ont besoin pour s'afficher, si bien que Google ne peut pas voir la page comme la voient les visiteurs.
  • Utiliser robots.txt pour retirer des pages de Google. Utilisez noindex (en laissant la page être explorée) ou, pour les cas urgents, l'outil Suppressions de la Search Console.
  • Associer un blocage dans robots.txt et un noindex sur la même page, ce qui empêche le noindex d'être vu.
  • Indiquer les mauvaises URL dans le sitemap : redirections, erreurs 404, pages noindex, versions http:// ou autre domaine.
  • Régler toutes les dates lastmod sur la date du jour à chaque build, ce qui les rend inutilisables pour les moteurs de recherche.
  • Un robots.txt qui renvoie une erreur serveur. Google interprète l'absence de robots.txt (404) comme « tout explorer », mais une erreur 5xx peut l'amener à cesser d'explorer le site jusqu'à ce que le fichier soit de nouveau disponible.

Questions fréquentes

Ai-je besoin d'un fichier robots.txt ?

Pas forcément. Si vous ne voulez interdire aucune zone aux robots, vous pouvez vous en passer ; un robots.txt qui renvoie 404 signifie que tout peut être exploré. Beaucoup de sites en ajoutent quand même un pour bloquer des zones de faible valeur, comme les résultats de recherche interne, et pour indiquer l'emplacement du sitemap.

Ai-je besoin d'un sitemap XML ?

Les petits sites dotés d'un bon maillage interne sont généralement découverts sans sitemap, mais celui-ci coûte peu et aide les moteurs de recherche à trouver plus vite les pages nouvelles ou mises à jour. Ce sont les sites volumineux, les sites récents et ceux dont les pages sont profondes ou mal reliées qui en tirent le plus de bénéfice.

Ajouter une page à mon sitemap suffit-il à la faire indexer ?

Non. Un sitemap aide les moteurs de recherche à découvrir des URL, mais l'indexation d'une page dépend de sa qualité, du fait qu'elle fasse ou non doublon avec d'autres pages, de la possibilité de l'explorer et de l'absence de noindex.

Comment bloquer les robots d'IA avec robots.txt ?

Ajoutez un groupe user-agent pour chaque robot à bloquer, par exemple GPTBot (OpenAI) ou CCBot (Common Crawl), avec Disallow: /. Google-Extended détermine si Google peut utiliser votre contenu pour ses modèles d'IA, sans incidence sur la recherche Google. Ces règles ne fonctionnent qu'avec les robots qui choisissent de respecter robots.txt.

Où placer robots.txt et sitemap.xml ?

robots.txt doit se trouver à la racine de chaque hôte, par exemple https://example.com/robots.txt. Un sitemap peut se trouver n'importe où sur l'hôte, mais /sitemap.xml est l'emplacement habituel ; déclarez son emplacement dans robots.txt et soumettez-le dans la Google Search Console.

Besoin d’une analyse plus poussée de votre site ?

Voyez tous les problèmes de votre site, classés par ordre de priorité

Vérifiez gratuitement n’importe quelle page, sans compte, ou inscrivez-vous pour explorer tout votre site. Chaque rapport couvre le SEO, les problèmes de performance courants, l’accessibilité et la sécurité, avec une correction suggérée pour chaque problème.