Déduplication conceptuelle dans un wiki

Idée centrale

La déduplication conceptuelle consiste à décider si deux formulations représentent la même connaissance canonique, des connaissances proches mais distinctes, ou des connaissances en relation. Elle évite que les synonymes fragmentent le wiki en pages orphelines.

Source directe — SRC-2026-001, section « The hardest scaling problem: concept deduplication ».

Problème

Une création libre de titres peut produire plusieurs pages pour un même objet. La source donne notamment les couples :

Ces couples illustrent aussi la difficulté : certains peuvent être synonymes dans un contexte et distincts dans un autre. La similarité lexicale ne suffit donc pas à décider.

Méthode

1. Normaliser

Comparer le titre proposé, ses variantes linguistiques, acronymes, formes singulier/pluriel et aliases.

2. Rechercher

Interroger l’index, les aliases, les liens entrants et le contenu des pages sémantiquement proches.

3. Comparer le périmètre

Évaluer :

4. Classer la relation

5. Mettre à jour les dépendances

Après une décision sûre, mettre à jour l’index, les aliases, les liens contextuels et la provenance. Une fusion substantielle de pages validées nécessite une décision humaine.

Système d’entités typées

La source recommande de définir une entité canonique une seule fois dans le schéma, puis d’y rattacher les termes rencontrés. Des relations explicites — is-a, part-of, contradicts, supersedes — rendent la structure plus informative qu’un simple ensemble de liens libres.

Synthèse éditoriale : les aliases résolvent les variantes de nom ; les relations typées résolvent les différences de périmètre. Les deux mécanismes sont complémentaires.

Critères de qualité

Erreurs fréquentes

Limites et nuances

La déduplication est contextuelle. Une ontologie utile pour la conformité bancaire ne se transpose pas automatiquement à la recherche en IA. La source propose des types de relations, mais ne fournit pas de protocole mesuré pour évaluer les décisions de fusion.

Relations

Sources