llms.txt : définition et utilité de ce fichier markdown
llms.txt : c'est quoi ? Définition, format markdown, exemple concret et différence avec le fichier robots.txt. Ce qu'il change vraiment pour votre site.
llms.txt : qu'est-ce que c'est ?
Le llms.txt est un fichier texte, écrit en markdown, qu'un site place à la racine de son domaine pour indiquer aux modèles de langage quelles pages lire en priorité. Son adresse ne change jamais : votresite.fr/llms.txt. On y trouve le nom du site, une description concise de l'activité, puis des liens vers les pages jugées pertinentes. C'est une carte volontairement courte, écrite par le propriétaire du site, qui pointe vers le contenu principal au lieu de laisser la machine tout explorer seule.
Une proposition, pas un standard officiel
L'idée vient du développeur Jeremy Howard et a été publiée en 2024 sur le site llmstxt.org. Aucun organisme de normalisation ne l'a validée depuis. Elle n'a donc pas le statut d'un standard du web, contrairement au protocole d'exclusion des robots ou au sitemap. Dans les faits, l'adopter relève du pari : vous fournissez un fichier au cas où certains acteurs décideraient de le consulter. Rien ne vous le reprochera, rien ne vous le récompensera non plus pour l'instant.
Un fichier à placer à la racine du domaine
Techniquement, créer le fichier ne demande aucune compétence rare : un éditeur de texte, un enregistrement en .txt, un dépôt à la racine du serveur. Pas de balise à insérer dans le code, pas d'extension obligatoire. Le fichier à placer à la racine doit rester lisible par un humain autant que par une machine. Si l'URL répond correctement dans un navigateur, la partie technique est terminée.
À quoi sert le fichier llms.txt ?
Son usage tient en une phrase : réduire le bruit. Un site de cent pages contient aussi des mentions légales, des archives, des pages de tri et des filtres sans intérêt. Une IA ne sait pas toujours séparer l'essentiel du décor. Le llms.txt lui fournit cette hiérarchie à l'avance, sous forme de sélection éditoriale assumée.
- Mettre en avant vos pages de services et vos définitions plutôt que vos pages légales
- Donner un contexte clair sur votre métier en une ou deux phrases
- Regrouper vos contenus par thème, comme un sommaire de livre
- Signaler les pages secondaires que la machine peut ignorer
- Garder une trace écrite de ce que vous voulez voir cité dans les réponses génératives
Tous les sites n'en ont pas le même besoin. Un site vitrine de cinq pages n'a rien à hiérarchiser : son contenu principal est déjà sous les yeux de tout le monde. Une documentation technique, un glossaire de cent définitions ou un catalogue de plusieurs milliers de références, c'est une autre affaire. Plus votre site est volumineux, plus l'idée de fournir un chemin balisé devient défendable.
L'objectif final reste celui du référencement dans les IA : apparaître dans les réponses de ChatGPT, Claude, Gemini ou Perplexity. Le llms.txt y contribue peut-être. Mais il ne remplace pas le travail de fond sur vos contenus, qui pèse infiniment plus lourd dans la balance.
Comment fonctionne ce format markdown ?
Le choix du markdown n'est pas décoratif. Ce format pèse peu, se lit sans interprétation et consomme moins de tokens qu'une page HTML bourrée de scripts. Un modèle qui lit du markdown voit immédiatement la hiérarchie : un titre, une citation, des listes de liens. Autre avantage pour vous : on relit un llms.txt en dix secondes et on corrige une ligne sans aucun outil.
La structure attendue du fichier
Le gabarit est simple. Un titre de niveau 1 pour le nom du site, une citation introduite par « > » pour le résumé, puis des sections de niveau 2 qui regroupent les liens par thème. Chaque ligne de lien suit le même modèle : des crochets pour le link title, des parenthèses pour l'URL, deux-points et une courte explication, ce que la proposition appelle les optional link details. Une section « ## Optional » recueille enfin les pages que le modèle peut sauter si le contexte devient trop long.
llms.txt et fichier robots.txt : quelle différence ?
La confusion est fréquente et elle est gênante. Le fichier robots indique ce qu'un robot a le droit de parcourir : il contrôle l'accès à vos répertoires, avec des règles que les crawlers sérieux respectent. Le llms.txt, lui, ne donne ni ne retire aucun droit. Il recommande une lecture, rien de plus.
- Le fichier robots autorise ou bloque l'exploration : c'est lui qui gouverne les permissions
- Le llms.txt suggère une lecture, sans aucune valeur contraignante
- Le sitemap liste toutes les URL à indexer, pour les moteurs de recherche
- Les données structurées décrivent le sens de chaque page dans son code source
Les trois premiers vivent déjà dans votre racine ou vos gabarits. Le sitemap XML et les données structurées de schema.org sont, eux, lus et exploités tous les jours. Si vous ne disposez que d'une heure, commencez par ceux-là. Le llms.txt vient après, jamais avant.
Un standard non officiel : où en est l'adoption ?
Les acteurs de l'IA ne se sont pas alignés. OpenAI et Anthropic publient un llms.txt pour leur propre documentation, ce qui montre que la convention séduit les créateurs d'outils. Cela ne prouve pas que leurs crawlers lisent le vôtre. Aucun grand fournisseur n'a documenté d'utilisation de ce fichier dans sa chaîne d'entraînement ou de recherche.
Du côté de Google, le message est net. John Mueller a comparé publiquement le llms.txt à la vieille balise meta keywords : un signal déclaré par le site, que personne ne vérifie. Google ne s'en sert pas. Son impact sur votre présence dans les AI Overviews est donc nul à ce jour.
Le reste du marché avance en silence. Certains éditeurs de moteurs de réponse disent s'y intéresser sans rien promettre. Dans le doute, voyez ce fichier comme une bouteille à la mer soigneusement rédigée : coût faible, bénéfice incertain.
Faut-il le mettre en place aujourd'hui ?
Oui, si votre site a de la documentation, un glossaire ou un catalogue à faire comprendre aux différentes IA. Mais ce fichier ne doit jamais passer avant vos contenus, votre maillage interne ou vos performances d'affichage. Comptez une heure de travail, pas un chantier. Et restez lucide sur le retour attendu : à ce stade, l'adoption est une anticipation, pas une technique éprouvée.
Les erreurs courantes à éviter
La plupart des llms.txt que l'on croise sur le web sont mal faits. Voici ce qui revient le plus souvent chez les propriétaires de sites pressés d'avoir coché la case.
- Recopier le sitemap entier : un fichier de 400 liens devient illisible, donc inutile
- Y faire figurer des pages sensibles ou privées : un fichier public n'est pas un coffre-fort
- Croire qu'il contrôle l'accès des robots, alors qu'il ne bloque absolument rien
- Écrire des descriptions creuses du type « notre page de services »
- L'oublier après la mise en ligne : des liens vers des URL mortes desservent le site
- Le générer automatiquement sans relecture, notamment via une extension WordPress mal réglée
Une règle générale suffit : restez concis et honnête. Vingt liens bien décrits valent mieux que deux cents lignes produites à la chaîne. Et si des agents IA viennent un jour lire ce fichier, ils tomberont sur un site déjà clair pour les humains : c'est bien là l'essentiel.
Questions fréquentes
C'est un fichier markdown placé à la racine d'un site, qui liste en quelques lignes les pages les plus utiles à lire pour une intelligence artificielle. Il joue le rôle d'un sommaire écrit par le site lui-même. Il n'impose rien et ne bloque rien.
Non. Google a fait savoir qu'il ne s'en servait pas, par la voix de John Mueller, qui le juge comparable à un signal déclaratif non vérifiable. Votre classement n'en dépend donc pas. Pour peser sur votre visibilité générative, travaillez plutôt le référencement dans les IA (GEO) et la qualité de vos pages.
Le fichier robots gère les autorisations d'exploration : il contrôle l'accès des crawlers à vos répertoires. Le llms.txt n'a aucun pouvoir de ce type, il se contente de recommander des contenus. L'un est un standard respecté depuis les années 1990, l'autre une convention nouvelle et facultative.
À lire aussi. Sur le même thème.
Préférences de cookies
Nous utilisons des cookies pour améliorer le site, comme expliqué dans notre politique de cookies. Vous pouvez refuser les cookies qui ne sont pas nécessaires.
Préférences de cookies
Ils font fonctionner le site : mémoriser votre choix de cookies, envoyer un formulaire, garder votre session ouverte. Sans eux, des parties du site cessent de marcher. Ils ne servent pas à vous suivre et ne peuvent pas être refusés.
Ils nous disent combien de personnes visitent le site et quelles pages sont lues, sous forme de statistiques. Ils nous aident à corriger ce qui ne va pas. Le site fonctionne sans eux.
Ils servent à mesurer nos campagnes publicitaires et à vous présenter des annonces adaptées sur d'autres sites. Le site fonctionne sans eux.