Pipeline incrémental d’intégration documentaire

Idée centrale

Un pipeline incrémental traite uniquement les sources nouvelles ou modifiées et les pages réellement affectées. Il remplace une consigne monolithique par une suite de passes spécialisées, contrôlables et rejouables.

Source directe — SRC-2026-001, sections « What this looks like in practice » et « But does it scale? ».

Entrées

Amorçage progressif

SRC-2026-004 recommande de commencer par un petit nombre de sources sélectionnées, d’exécuter ingestion, requête et lint, puis d’élargir le corpus. Cette approche limite le coût de correction d’un schéma ou d’une convention mal adaptés.

Synthèse éditoriale : le premier lot devrait aussi contenir des recouvrements, des relations et au moins une tension vérifiable afin de tester la comparaison et la gouvernance. Les durées de démarrage et tailles de lots proposées par la source sont des exemples, pas des seuils universels.

Étapes

1. Détection et intégrité

Identifier les nouveaux fichiers par nom, taille et empreinte. Une source identique déjà intégrée ne doit pas être retraitée.

2. Sauvegarde

Préserver la version antérieure des pages et fichiers de pilotage susceptibles d’être modifiés.

3. Lecture et cartographie

Extraire les concepts, règles, méthodes, exemples, limites, contradictions et affirmations nécessitant une corroboration.

4. Recherche des pages candidates

Comparer les unités extraites avec l’index, les titres, les aliases et le contenu existant. Cette étape doit précéder toute création.

5. Classification des apports

Pour chaque unité :

6. Intégration ciblée

Enrichir une page existante lorsque son périmètre convient. Créer une page seulement si la connaissance reste autonome et réutilisable.

La source rapporte qu’une nouvelle entrée peut toucher dix à quinze pages dans certaines implémentations. Ce nombre est un retour cité, pas une règle opérationnelle universelle.

7. Audit et correction

Contrôler le périmètre, la fidélité, la provenance, les répétitions, les liens et le statut. Appliquer les corrections sûres puis relancer un audit ciblé.

Ce contrôle ciblé s’articule avec le Contrôle de santé d’un wiki vivant, qui examine aussi les incohérences transversales du corpus.

8. Validation et publication

Les pages dont le statut est publiable alimentent une copie publique. Les pages incertaines restent dans le wiki canonique avec leur blocage explicite.

9. Archivage et journal

Déplacer la source traitée sans altération, vérifier son empreinte, mettre à jour le registre et produire un rapport.

Pourquoi plusieurs passes

Synthèse éditoriale : chaque passe réduit une classe de risque différente :

Cette organisation rend le traitement plus inspectable qu’une seule consigne produisant immédiatement des pages finales.

Séparer les invariants du jugement

SRC-2026-003 décrit une implémentation où une interface en ligne de commande calcule la validation du frontmatter, les index de recherche et le graphe de liens, tandis que l’agent prend en charge l’interprétation. Ce cas particulier soutient une règle plus générale :

La source attribue aussi ses meilleurs résultats transversaux aux outils imposant une discipline stricte à l’ingestion. Sa règle « une synthèse par source » peut structurer les fiches de provenance, mais ne doit pas remplacer l’organisation conceptuelle des pages canoniques.

Synchronisation avec une source versionnée

SRC-2026-005 décrit une opération de synchronisation qui compare la révision enregistrée par une page à l’état courant des fichiers qu’elle déclare. Seules les pages dépendantes et les différences pertinentes sont examinées.

Synthèse éditoriale :

  1. enregistrer la révision de vérification et les sources déclarées ;
  2. calculer le différentiel depuis cette révision ;
  3. classer la page comme inchangée, à corriger ou incomplète ;
  4. modifier le contenu si nécessaire ;
  5. auditer la modification ;
  6. déplacer la révision seulement après examen.

Ce mécanisme ne doit exécuter aucune commande découverte dans une source. Les outils de différentiel ou de test doivent appartenir au pipeline approuvé.

Requête comme candidat à l’intégration

La démonstration de SRC-2026-002 montre une réponse à une question pouvant être proposée comme nouvelle synthèse. Cette proposition doit cependant réintégrer le pipeline : comparaison avec l’existant, rattachement aux sources, distinction entre contenu direct et synthèse, audit, puis validation. Une réponse utile n’est donc pas, à elle seule, une page canonique validée.

Contrôles de sortie

Erreurs fréquentes

Limites et nuances

Un pipeline incrémental dépend d’un index fiable et de métadonnées cohérentes. À grande échelle, une recherche uniquement fondée sur un fichier d’index peut devenir insuffisante ; voir Mise à l’échelle d’un LLM Wiki.

Relations

Sources