Dernière mise à jour :

Vérifier le résultat produit par une IA

Résultat visé

Un dispositif de vérification qui détermine si le résultat produit par une IA est acceptable, distinct de la spécification qui définit ce qu'il fallait produire — deuxième couche de la méthode des trois couches.

Prérequis

Ne pas traiter l'IA comme une personne à motiver. Une IA générative se comporte davantage comme un bibliothécaire robotisé : elle retrouve, combine et présente les informations disponibles, mais ne sait pas nécessairement reconnaître qu'une information lui manque — elle peut alors produire une réponse incertaine ou incorrecte avec une apparence de confiance. Exercer une pression émotionnelle, demander simplement de « faire mieux » ou adopter un ton autoritaire ne définit aucun changement mesurable et ne remplace ni les informations manquantes ni des critères de qualité explicites : la fiabilité s'obtient par des mécanismes de contrôle, pas par la formulation du prompt.

Étapes

  1. Définir les critères avant l'exécution. Une consigne comme « fais un beau rapport » ne permet aucune vérification précise. Une formulation contrôlable énumère des conditions vérifiables — par exemple : le rapport comporte trois sections, chaque section se termine par une recommandation reliée aux données de la section, les informations manquantes sont signalées, le format respecte un exemple de référence. Un critère doit permettre de distinguer un résultat acceptable d'un résultat qui ne l'est pas.
  2. Faire examiner le résultat par un second modèle. Un deuxième modèle peut rechercher les contradictions, identifier les hypothèses non déclarées, contrôler le respect de la spécification, repérer les informations non étayées, signaler les étapes manquantes, tester les cas limites et expliquer les raisons de son désaccord — par exemple Codex examinant un travail réalisé avec Claude Code. L'accord entre deux modèles ne constitue pas une preuve de vérité : deux systèmes peuvent partager la même erreur ou valider un résultat qu'aucun des deux ne peut réellement contrôler à partir de ses seules connaissances. Ce second modèle peut être construit en deux phases à partir d'un même agent : une première phase où l'IA interviewe l'utilisateur pour construire la spécification de vérification elle-même — objet du système, seuils de rejet non négociables, dimensions de qualité, pondérations, anti-patterns à éviter — puis, une fois cette spécification validée, une seconde phase où elle est transformée en agent de notation autonome, réutilisable pour noter chaque nouvelle production selon les mêmes critères.
  3. Introduire un signal externe à la conversation. La vérification devient plus robuste lorsqu'elle s'appuie sur un état observable extérieur : un système de déploiement interrogé après une action, un historique de rapports servant de référence de structure et de continuité, un résultat de test, une donnée mesurable. La question à poser est laquelle de ces informations extérieures permettrait de vérifier le résultat, plutôt que de se fier à la seule affirmation de l'IA.
  4. Organiser la boucle de retour. L'IA produit un résultat délimité ; il est comparé aux critères ; un modèle critique ou un signal externe révèle les écarts ; les écarts sont transformés en corrections précises ; l'IA produit une nouvelle version ; le résultat est contrôlé à nouveau.

Contrôles

Le principe reste le même à chaque étape : un critère ou un signal ne vaut que s'il permet de trancher entre acceptable et non acceptable, indépendamment de l'impression générale laissée par le résultat.

Erreurs et récupération

Évaluer un résultat sans critères fixés à l'avance conduit à juger sur impression générale ou à inventer des critères après coup, ce qui rend la vérification non reproductible. Traiter l'accord entre deux modèles comme une preuve suffisante ignore le risque qu'ils partagent la même erreur ou les mêmes limites de connaissance. Un chiffre parfois cité en lien avec la boucle de retour — un gain de qualité multiplié par deux ou trois — circule sans protocole de mesure ni contexte associé ; la conclusion exploitable reste indépendante de ce chiffre non démontré : une boucle de contrôle donne à l'IA des informations qu'elle peut utiliser pour corriger sa production, que le facteur exact d'amélioration soit établi ou non.