Sitemap XML : définition, format et lien avec robots.txt
Sitemap XML : à quoi sert ce fichier, comment le créer et l'envoyer à Google via robots.txt ou la Search Console. Définition claire, exemple de code, erreurs à éviter.
Sitemap XML : la définition
Déposé à la racine du site, un sitemap XML énumère les adresses de vos pages importantes. Sitemap : voyez-le comme un sommaire écrit pour les machines (vos visiteurs, eux, n'en verront jamais la couleur). Chaque entrée porte une URL et, le plus souvent, la date de sa dernière modification. Le format ? Un protocole public, documenté sur sitemaps.org, que respectent Google, Bing et Yahoo.
Le mot sème la confusion. Un « plan du site » en HTML, c'est une page visible, pensée pour l'internaute qui ne retrouve plus son chemin. Rien à voir ici : on parle du document technique que lit un moteur de recherche, baptisé sitemap.xml dans la quasi-totalité des cas.
À quoi sert un sitemap XML
Comment un robot trouve-t-il vos pages ? En suivant les liens, et seulement par là. Dès que le maillage interne présente des trous, des adresses restent hors d'atteinte. Le sitemap bouche la brèche : il livre d'un coup la liste des pages que vous voulez faire explorer. Sur un site jeune ou un catalogue énorme, la différence saute aux yeux !
Une mise au point, maintenant. Déclarer une URL ne force personne à l'indexer : Google écarte sans état d'âme ce qu'il juge pauvre ou dupliqué. Découverte plus rapide, oui. Travail de fond sur le référencement naturel économisé, non.
- Pousser rapidement les pages d'un site tout juste mis en ligne
- Dater la dernière retouche d'un article ou d'une fiche produit
- Offrir une porte d'entrée aux URL que personne ne lie en interne
- Voir dans Google Search Console ce qui est lu et ce qui passe à la trappe
Comment fonctionne un fichier sitemap
Techniquement, rien d'intimidant : un document XML encodé en UTF-8. Une balise urlset l'ouvre, puis chaque page occupe son propre bloc url. Dedans, loc porte l'adresse complète, protocole compris. Trois balises optionnelles viennent compléter le tableau.
- urlset : elle ouvre et referme l'ensemble du fichier
- loc : l'adresse complète de la page — http://www.example.com/contact/, par exemple
- lastmod : la date de dernière modification, écrite AAAA-MM-JJ
- changefreq et priority : fréquence et priorité déclarées… que les moteurs ignorent largement
Deux plafonds à connaître : 50 000 adresses et 50 Mo par fichier. Au-delà, vous passez à un sitemap index, un fichier qui ne liste pas des pages mais d'autres sitemaps. Les boutiques en ligne fonctionnent presque toutes ainsi. Le robot lit l'index, puis ouvre chaque fichier au rythme de sa file d'attente d'exploration.
Comment créer un sitemap XML
Trois chemins s'offrent à vous, du tout-automatique au cousu main. Votre nombre de pages et l'outil qui propulse le site trancheront.
Laisser la machine le générer
C'est la voie que je recommande dès que le site vit vraiment. La plupart des CMS fabriquent le fichier et le tiennent à jour sans vous : extension SEO sous WordPress, module dédié sous Drupal, génération native chez Shopify. Site statique ? Un générateur en ligne vous rend un fichier prêt à déposer.
Rédiger son sitemap à la main
Pour une vitrine d'une dizaine de pages, un éditeur de texte fait le travail. Vous tapez les blocs un par un, vous enregistrez en .xml, vous déposez à la racine. Deux précautions : n'y faites figurer que des adresses canoniques, et des pages qui répondent sans passer par une redirection. L'encodage UTF-8, ne l'oubliez pas non plus.
Le format texte, RSS et Atom
Rien ne vous oblige à passer par le XML. Un sitemap texte, c'est un .txt avec une URL par ligne, aucune balise, encodage UTF-8. Les flux RSS, mRSS et Atom 1.0 conviennent aussi : ils ne portent que les contenus récents, ce qui tombe bien pour un blog actif. En revanche, ils n'acceptent rien de plus que l'adresse et une date.
Les outils qui font gagner du temps
- Un générateur — celui du CMS, ou un service en ligne si le site est statique
- Un validateur de syntaxe, à passer avant toute publication
- Un checker, qui confronte la liste déclarée aux pages réellement accessibles
- Les logs serveur : ils disent quelles URL les robots visitent pour de bon
Robots.txt et Search Console : envoyer votre sitemap
Fabriquer le document ne suffit pas, encore faut-il le déclarer. Deux voies pour cela, et rien ne vous interdit de prendre les deux.
Déclarer plusieurs sitemaps dans le fichier robots.txt
En arrivant sur un domaine, un robot ouvre d'abord le fichier robots. Il y trouve les répertoires autorisés ou interdits, et il accepte une ligne par sitemap. Sitemap après sitemap, vous déclarez ainsi la totalité de vos fichiers d'un coup, et n'importe quel moteur y accède sans avoir de compte à créer.
- Sitemap: https://www.example.com/sitemap.xml
- Sitemap: https://www.example.com/sitemap-produits.xml
- Une directive par ligne, et toujours l'adresse absolue
Envoyer le sitemap via Google Search Console
Ouvrez le rapport Sitemaps dans Google Search Console, collez le chemin du fichier, validez. Rien n'empêche d'en envoyer plusieurs à la suite, ou un index unique qui pointe vers les autres. L'intérêt va plus loin que la simple déclaration : vous récupérez le nombre d'URL lues, les erreurs relevées et la date du dernier passage.
Erreurs courantes et dépannage
Les ennuis naissent rarement de la syntaxe, presque toujours du contenu. Un sitemap et les URL qu'il contient doivent raconter la même histoire que le site réel. Sinon ? Dès qu'il annonce des adresses mortes, il dilapide une part de votre budget d'exploration.
Deux cas reviennent sans cesse. Les pages disparues d'abord : une erreur 404 oubliée dans la liste envoie un signal contradictoire. Les doublons ensuite — quand un lien canonique désigne une autre version, c'est celle-là, et pas une autre, qui doit figurer dans le fichier sitemap. Après chaque refonte, un coup d'œil au rapport de la Search Console (le réflexe coûte peu).
- Mélanger http et https, ou les variantes avec et sans www
- Lister des pages que le fichier robots.txt bloque par ailleurs
- Remettre à jour la date de lastmod à chaque passage, ce qui la vide de son sens
- Franchir les 50 000 URL sans découper en plusieurs sitemaps
- Déposer le document ailleurs qu'à la racine du domaine
Peu de règles suffisent, en réalité : une seule version de chaque adresse, des dates sincères, une génération automatique, une déclaration dans robots.txt. Passé quelques centaines de pages, confiez l'audit de l'ensemble à un spécialiste du référencement SEO.
Questions fréquentes
Un fichier qui énumère les adresses des pages d'un site, dans un format standard que les moteurs savent lire. Il dit quelles URL existent et quand elles ont bougé. L'exploration y gagne ; l'indexation, elle, n'est jamais garantie.
Tapez example.com/sitemap.xml, puis example.com/sitemap_index.xml si la première adresse reste muette. Toujours rien ? Ouvrez le fichier robots.txt du domaine : la directive Sitemap y indique en général le bon chemin. Pour votre propre site, la Search Console affiche la liste complète.
Le sitemap énumère ce que vous souhaitez voir explorer. Le fichier robots.txt tient le discours inverse : voici ce que les robots doivent laisser de côté, et voilà où se trouve le sitemap. L'un invite, l'autre encadre.
À lire aussi. Sur le même thème.
Préférences de cookies
Nous utilisons des cookies pour améliorer le site, comme expliqué dans notre politique de cookies. Vous pouvez refuser les cookies qui ne sont pas nécessaires.
Préférences de cookies
Ils font fonctionner le site : mémoriser votre choix de cookies, envoyer un formulaire, garder votre session ouverte. Sans eux, des parties du site cessent de marcher. Ils ne servent pas à vous suivre et ne peuvent pas être refusés.
Ils nous disent combien de personnes visitent le site et quelles pages sont lues, sous forme de statistiques. Ils nous aident à corriger ce qui ne va pas. Le site fonctionne sans eux.
Ils servent à mesurer nos campagnes publicitaires et à vous présenter des annonces adaptées sur d'autres sites. Le site fonctionne sans eux.