Tout comprendre sur RankerSquare Voir

Robots.txt : définition, syntaxe et exemples concrets

Robots.txt : la définition, les directives User-agent, Disallow, Allow et Sitemap, des exemples prêts à copier et les erreurs qui font chuter un site.

Robots.txt : définition et rôle du fichier

Le robots.txt est un fichier texte, déposé à la racine d'un site web, qui dit aux robots des moteurs de recherche quelles adresses ils peuvent parcourir et lesquelles ils doivent laisser de côté. C'est quoi le robots.txt ? Un fichier de quelques lignes, lisible dans n'importe quel éditeur de texte. Il s'appuie sur une convention née au milieu des années 1990, que les documents techniques nomment encore the Robots Exclusion Protocol.

Ce n'est pas un outil de sécurité, mais un panneau de signalisation : les crawlers de Google ou de Bing s'y conforment, un aspirateur de contenu peut l'ignorer sans aucune conséquence.

Où doit se trouver le fichier robots.txt

Le fichier doit se trouver à une adresse unique et prévisible : exemple.com/robots.txt. Il faut donc le placer à la racine du domaine, jamais dans un sous-dossier, car un fichier posé sur exemple.com/blog/robots.txt n'est lu par personne. Le nom exact du fichier robots.txt (robots au pluriel, en minuscules, extension .txt) ne tolère aucune variante. Chaque sous-domaine a son propre fichier.

Exploration et indexation : deux étapes différentes

Un moteur de recherche travaille en deux temps : il explore, puis il indexe. Le robots.txt n'agit que sur le premier. Bloquer une adresse empêche Googlebot d'en lire le contenu, mais Google peut tout de même indexer cette URL si d'autres sites pointent vers elle. Pour sortir réellement une page des résultats, c'est la balise noindex qui fait le travail, et elle exige que la page reste accessible.

À quoi sert un fichier robots.txt

Son premier usage est économique. Les robots d'exploration ne consacrent qu'un temps limité à chaque site : si l'essentiel part dans des pages de filtres ou de recherche interne, vos pages commerciales passent en dernier. Orienter les crawlers vers ce qui compte revient à protéger votre crawl budget, un sujet concret dès quelques milliers d'URL.

  • Empêcher l'exploration des zones sans intérêt pour le référencement : back-office, espace client, pages de tri.
  • Éviter que certains paramètres d'URL ne fabriquent des milliers de variantes à explorer pour rien.
  • Indiquer l'emplacement du plan du site pour aider les robots à trouver vos pages plus vite.
  • Limiter le passage des robots d'IA génératives, si vous souhaitez protéger vos contenus.

Ce que le fichier ne sait pas faire

Le fichier robots.txt ne garantit rien. C'est une consigne, pas une serrure. Il ne protège aucune donnée, ne remplace pas un mot de passe et ne supprime pas une adresse déjà présente dans Google. Pour empêcher Google d'afficher une page, il faut au choix la laisser explorable avec une directive noindex, ou la fermer derrière une authentification.

Syntaxe et directives du fichier robots

Quatre directives structurent un fichier robots : user-agent, disallow, allow et sitemap. Chacune s'écrit sur sa propre ligne, sous la forme « nom : valeur », avec deux-points et un espace.

User-agent : à qui s'adresse la règle

La directive user-agent ouvre un bloc et désigne le robot concerné. L'étoile vise tous les crawlers d'un coup. Pour viser le robot principal de Google, on écrit un bloc user-agent: googlebot, et chaque moteur a son nom propre : Bingbot, Googlebot-Image, Applebot. Un robot ne lit que le bloc qui le nomme le plus précisément : dès qu'un bloc agent: googlebot existe, Googlebot applique celui-là et laisse de côté les règles de l'étoile.

Disallow et Allow : bloquer ou autoriser l'accès

Disallow indique un chemin que le robot ne doit pas explorer. Allow sert à autoriser une exception à l'intérieur d'un dossier fermé. La forme la plus répandue est user-agent: * disallow suivie du chemin visé, par exemple /panier/. Attention au piège : une ligne disallow laissée vide autorise tout, alors qu'un disallow: / seul bloque le site entier, le fameux disallow all à réserver aux environnements de test.

  • L'étoile * remplace n'importe quelle suite de caractères dans un chemin.
  • Le dollar $ marque la fin d'une URL, pratique pour viser une extension de fichier.
  • Le dièse # introduit un commentaire, que les robots ignorent.
  • En cas de conflit, Google retient la règle la plus longue, donc la plus spécifique.
  • Les chemins respectent la casse : /Produits/ et /produits/ sont deux chemins différents.

Pour laisser un robot accéder à une seule ressource d'un dossier bloqué, on combine les deux : le disallow ferme le dossier, la ligne suivante ouvre le fichier précis dont vous avez besoin. Il est possible de répéter l'opération autant de fois que nécessaire.

Sitemap : indiquer où trouver vos URL

La directive sitemap donne l'adresse complète du plan du site, écrite en absolu, et peut figurer n'importe où dans le fichier. Elle est indépendante des blocs user-agent : tous les moteurs la lisent. Le format du fichier et sa construction sont détaillés dans notre définition du sitemap XML.

Exemples de robots.txt et erreurs courantes

Sur une boutique en ligne, on ajoute le panier, le tunnel de commande et la recherche interne. Un bloc user-agent: googlebot séparé n'a d'intérêt que si vous traitez Googlebot différemment des autres ; sinon, un seul bloc avec l'étoile suffit et se relit mieux six mois plus tard.

Les erreurs qui coûtent le plus cher

  • Laisser en ligne un disallow: / hérité de la préproduction : le site quitte les résultats en quelques jours.
  • Bloquer les dossiers de ressources CSS et JavaScript : Google ne voit plus la page comme un visiteur la voit.
  • Compter sur ce fichier pour désindexer une adresse, alors que le blocage empêche Google de lire la directive noindex.
  • Placer le fichier ailleurs qu'à la racine, ou le nommer Robots.TXT.
  • Oublier la barre oblique finale et bloquer bien plus large que prévu.
  • Renvoyer une erreur serveur sur /robots.txt : Google peut alors suspendre l'exploration.

Un point important : une URL bloquée depuis des mois ne sortira pas de l'index toute seule. Il faut d'abord rouvrir l'accès, laisser Google repasser, puis appliquer la bonne consigne sur la page. Et quand plusieurs versions d'une même page circulent, c'est le lien canonique qui tranche.

Tester et modifier son robots.txt dans la Search Console

Avant toute intervention, consultez votre fichier actuel : tapez votre nom de domaine suivi de /robots.txt dans un navigateur. La Google Search Console propose un rapport dédié, qui affiche la dernière version lue par Google, la date de lecture et les erreurs de syntaxe. L'inspection d'URL vous dit ensuite, adresse par adresse, si l'exploration est autorisée.

Si une page stratégique n'est jamais explorée, essayez les solutions ci-dessous, dans cet ordre.

  • Ouvrez l'inspection d'URL dans la Search Console et lisez la ligne « Exploration autorisée ».
  • Repérez la directive responsable dans le rapport robots.txt, puis corrigez-la.
  • Vérifiez qu'aucun bloc user-agent plus spécifique ne prend le pas sur vos règles générales.
  • Demandez une nouvelle exploration : la prise en compte prend de quelques heures à quelques jours.
  • Confirmez avec un validator ou un checker en ligne, qui simule le comportement d'un crawler.

Où modifier le fichier selon votre site

Sur un site développé sur mesure, le fichier se dépose à la racine du serveur, par FTP ou via le dépôt de code. Sur WordPress, les extensions de référencement offrent un éditeur intégré. Sur Wix ou Shopify, il est généré automatiquement et l'édition passe par un écran dédié, parfois limité. Si vous avez encore besoin d'aide, un regard extérieur sur toute la configuration technique rapporte souvent davantage qu'une ligne corrigée : c'est le point de départ de tout référencement SEO solide.

Robots des IA : autoriser ou bloquer l'accès ?

Les robots des modèles d'intelligence artificielle utilisent le même protocole d'exclusion. GPTBot, ClaudeBot, PerplexityBot, Google-Extended : chacun se déclare avec un nom de user-agent que vous pouvez cibler dans un bloc dédié. La question n'est plus technique, elle est stratégique.

Pour la grande majorité des TPE et PME, bloquer ces robots n'a pas d'intérêt : être cité dans une réponse générée amène des visiteurs déjà convaincus, et c'est tout l'objet du référencement IA. Certains éditeurs dont le contenu est le produit font le choix inverse. Entre les deux, un fichier llms.txt guide ces robots sans leur fermer la porte.

Questions fréquentes

Tapez l'adresse du site suivie de /robots.txt dans votre navigateur. Le fichier s'affiche en texte brut, ou vous obtenez une erreur 404 si le site n'en a pas. C'est valable pour n'importe quel domaine, exemple.com comme le vôtre.

Le robots.txt empêche le robot de venir lire la page ; la balise noindex lui demande de ne pas l'afficher dans les résultats. Les deux ne se cumulent pas : si l'accès est bloqué, Google ne lira jamais la balise. Pour désindexer, on autorise l'exploration et on applique le noindex.

Sans fichier, tout est explorable, et pour un petit site vitrine cela ne pose pas de problème. Mais un fichier minimal, réduit à l'étoile et à la ligne sitemap, évite les erreurs 404 répétées. Dès quelques centaines de pages, il devient utile.

À lire aussi. Sur le même thème.