Ingestion en masse de corpus structurés
Résultat visé
Importer un corpus volumineux et structuré — dépôt de spécifications, dump encyclopédique, archive de messages, instantanés web archivés — comme un ensemble de sources immuables individuellement traçables, sans produire un article de wiki par page importée et sans recourir à un exploration HTML non structurée.
Prérequis
Identifier la forme du corpus amont avant de choisir un adaptateur : dépôt Git de documents ou de propositions type BIP, dump ou site interrogeable MediaWiki, archive de messages au format CSV/TSV/JSON, ou ensemble d'instantanés indexés par l'Internet Archive (Wayback CDX). Un corpus qui ne correspond à aucune de ces formes structurées relève d'une ingestion source par source classique, pas de ce mécanisme.
Étapes
- Choisir l'adaptateur. Git pour un dépôt de documents ou de propositions (priorité aux fichiers de proposition reconnus, avec extraction de leurs en-têtes) ; dump MediaWiki pour un flux XML complet, avec exclusion par défaut des redirections et espaces de noms non éditoriaux ; API MediaWiki pour un import ciblé sans dump complet ; archive de messages pour un fichier CSV/TSV/JSON/JSONL, dont les champs identifiant/date/auteur/sujet/corps sont inférés automatiquement ; Wayback CDX pour un ensemble borné d'instantanés archivés, convertis en markdown lisible.
- Prévisualiser l'ampleur. Avant un import volumineux, prévisualiser la forme du manifeste de collection et le nombre estimé de sources enfants ; une limite explicite ou un mode simulation permet de plafonner ou d'examiner l'import avant de l'exécuter pour de bon.
- Écrire le manifeste et les sources enfants. Chaque import de collection écrit un manifeste de collection, plus une source immuable par page ou entrée amont, avec une provenance adaptée à l'adaptateur (identifiant amont, révision ou hash, URL canonique, licence si connue). La déduplication se fait par la combinaison collection + identifiant amont + révision, jamais en écrasant une source déjà écrite : un contenu amont modifié produit une nouvelle source plutôt qu'une réécriture silencieuse.
- Compiler sélectivement. La compilation en articles reste volontairement sélective — concepts, thèmes, chronologies, glossaires, familles de standards, index de référence — plutôt que de générer mécaniquement un article par page importée, ce qui produirait un wiki dilué par le volume plutôt qu'organisé par le sens.
Contrôles
Pour un corpus de type proposition communautaire, la simple présence d'un document ne prouve ni son adoption ni un consensus autour de lui — la source enfant atteste seulement de son existence et de son contenu. Pour un corpus de type wiki communautaire, le niveau de confiance par défaut reste modéré, sauf corroboration par une source plus solide.
Erreurs et récupération
Explorer récursivement du HTML non structuré à la place d'une interface amont structurée produit un import bruyant et difficile à dédupliquer ; les interfaces dédiées (API, dump, CDX) existent précisément pour éviter ce problème. Générer un article compilé par page importée, plutôt que de compiler sélectivement, dilue le wiki en un miroir volumineux du corpus amont au lieu d'en extraire une synthèse organisée — voir Frontières entre sources, wiki, inventaire et datasets pour la distinction entre un corpus qui reste une source à référencer et une connaissance réellement synthétisée.