Surfaces lisibles par machine
En plus de ses pages destinées aux humains, le site publie des surfaces conçues pour les outils: robots d’indexation, lecteurs de flux, outils de sécurité et modèles de langage. L’inventaire complet, avec les liens actifs, est la page légale Fichiers publics lisibles par machine; cette page-ci énonce les règles — quelles familles de surfaces existent, pourquoi, et comment une nouvelle surface s’ajoute.
Deux sitemaps#
Un sitemap XML est pour les moteurs de recherche. Un plan de site HTML est pour les humains.
/sitemap.xml est généré par Hugo et liste les URL canoniques pour les robots. Le plan de site lisible par les humains est volontairement sélectif: un index structuré des pages qu’une personne pourrait vraiment vouloir visiter, pas un inventaire de chaque URL générée. Les flux, les alias de langue et les pages individuelles de mots-clés n’y ont pas leur place.
Le plan de site HTML est une page de contenu normale avec un gabarit dédié — des fichiers de contenu pour le sens, des gabarits pour la structure:
---
title: "Plan du site"
layout: "sitemap"
translationKey: "sitemap"
---Le gabarit choisit les sections importantes et liste leurs pages; une page mérite sa place en étant utile à la lecture, pas en étant simplement possible à générer.
Fichiers de contexte pour les LLM#
/llms.txt fournit un contexte concis du site pour les modèles de langage, et /llms-full.txt la version étendue. Les deux suivent la proposition llms.txt, qui normalise un fichier racine aidant les LLM à utiliser un site web au moment de l’inférence. Les permissions de collecte et d’entraînement restent régies par /robots.txt et les en-têtes X-Robots-Tag, comme l’énonce l’inventaire légal.
Flux#
Chaque langue publie trois formats de syndication: RSS (index.xml), Atom (index.atom) et JSON Feed (feed.json). Les flux sont des surfaces pour les outils des lecteurs, pas des pages à naviguer; ils restent donc hors du plan de site HTML.
Fichiers de sécurité et de contact#
/.well-known/security.txt et sa copie racine portent les métadonnées de divulgation de vulnérabilités et de contact de sécurité; /humans.txt et sa copie de compatibilité créditent les personnes et les outils derrière le site.
Comment les surfaces sont publiées#
Deux conventions de génération couvrent toutes les surfaces:
- Page de contenu avec un
url:explicite : les fichiers texte racine commesecurity.txt,humans.txtetllms.txtsont des fichiers de contenu normaux dont le front matter réclame le chemin racine, selon la stratégie d’URL - Formats de sortie et gabarits Hugo :
/sitemap.xml, les flux et l’index de recherche sous/pagefind/sont générés au moment du build à partir des pages existantes, sans fichier de contenu à éditer
Ajouter une nouvelle surface#
- privilégiez un nom et un emplacement standards: les fichiers établis restent à la racine du site, les métadonnées plus récentes vont sous
/.well-known/ - publiez-la comme fichier de contenu avec
url:quand elle a du contenu à éditer; utilisez un format de sortie quand elle dérive des pages existantes - inscrivez-la dans la page légale d’inventaire, dans les deux langues
- gardez-la hors des index destinés aux lecteurs quand ce n’est pas une page de lecture, avec
sitemap_excludeetpagefind_exclude