Surfaces lisibles par machine

En plus de ses pages destinées aux humains, le site publie des surfaces conçues pour les outils: robots d’indexation, lecteurs de flux, outils de sécurité et modèles de langage. L’inventaire complet, avec les liens actifs, est la page légale Fichiers publics lisibles par machine; cette page-ci énonce les règles — quelles familles de surfaces existent, pourquoi, et comment une nouvelle surface s’ajoute.

Deux sitemaps#

Un sitemap XML est pour les moteurs de recherche. Un plan de site HTML est pour les humains.

/sitemap.xml est généré par Hugo et liste les URL canoniques pour les robots. Le plan de site lisible par les humains est volontairement sélectif: un index structuré des pages qu’une personne pourrait vraiment vouloir visiter, pas un inventaire de chaque URL générée. Les flux, les alias de langue et les pages individuelles de mots-clés n’y ont pas leur place.

Le plan de site HTML est une page de contenu normale avec un gabarit dédié — des fichiers de contenu pour le sens, des gabarits pour la structure:

---
title: "Plan du site"
layout: "sitemap"
translationKey: "sitemap"
---

Le gabarit choisit les sections importantes et liste leurs pages; une page mérite sa place en étant utile à la lecture, pas en étant simplement possible à générer.

Fichiers de contexte pour les LLM#

/llms.txt fournit un contexte concis du site pour les modèles de langage, et /llms-full.txt la version étendue. Les deux suivent la proposition llms.txt, qui normalise un fichier racine aidant les LLM à utiliser un site web au moment de l’inférence. Les permissions de collecte et d’entraînement restent régies par /robots.txt et les en-têtes X-Robots-Tag, comme l’énonce l’inventaire légal.

Flux#

Chaque langue publie trois formats de syndication: RSS (index.xml), Atom (index.atom) et JSON Feed (feed.json). Les flux sont des surfaces pour les outils des lecteurs, pas des pages à naviguer; ils restent donc hors du plan de site HTML.

Fichiers de sécurité et de contact#

/.well-known/security.txt et sa copie racine portent les métadonnées de divulgation de vulnérabilités et de contact de sécurité; /humans.txt et sa copie de compatibilité créditent les personnes et les outils derrière le site.

Comment les surfaces sont publiées#

Deux conventions de génération couvrent toutes les surfaces:

  • Page de contenu avec un url: explicite : les fichiers texte racine comme security.txt, humans.txt et llms.txt sont des fichiers de contenu normaux dont le front matter réclame le chemin racine, selon la stratégie d’URL
  • Formats de sortie et gabarits Hugo : /sitemap.xml, les flux et l’index de recherche sous /pagefind/ sont générés au moment du build à partir des pages existantes, sans fichier de contenu à éditer

Ajouter une nouvelle surface#

  • privilégiez un nom et un emplacement standards: les fichiers établis restent à la racine du site, les métadonnées plus récentes vont sous /.well-known/
  • publiez-la comme fichier de contenu avec url: quand elle a du contenu à éditer; utilisez un format de sortie quand elle dérive des pages existantes
  • inscrivez-la dans la page légale d’inventaire, dans les deux langues
  • gardez-la hors des index destinés aux lecteurs quand ce n’est pas une page de lecture, avec sitemap_exclude et pagefind_exclude