← Retour à toutes les analyses
Gouvernance · 4 min de lecture

Votre employé IA apprend‑il vraiment de ses erreurs ?

Une méthode concrète pour transformer les corrections humaines en règles, données et tests qui améliorent un employé IA sans dérive silencieuse.

Publié le · Par Équipe Pulse

Corriger une sortie ne suffit pas à améliorer un employé IA.

Si la correction d’une échéance, d’un email ou d’une qualification disparaît après validation, le système peut répéter l’erreur. Si elle modifie immédiatement son comportement, une préférence isolée peut devenir une règle dangereuse. La boucle utile conserve le signal, cherche sa cause et teste le changement avant déploiement.

Une correction n’est pas encore un apprentissage

Une sortie peut être mauvaise à cause d’une source incomplète, d’une donnée erronée, d’une règle ambiguë, d’un outil mal appelé ou d’un cas exceptionnel. Changer le prompt à chaque erreur mélange ces causes.

OpenAI recommande des évaluations propres à la tâche, alimentées par des cas réels et calibrées avec du jugement humain, plutôt qu’une appréciation vague du type « cela semble fonctionner ».[1]

La boucle d’apprentissage Pulse

  1. Observer. Conserver l’entrée, les sources utilisées, la sortie proposée et la correction humaine.
  2. Qualifier. Classer l’écart : donnée, règle, permission, outil, format ou exception.
  3. Corriger la bonne couche. Modifier la source, l’instruction, le workflow ou le périmètre d’accès. Le modèle n’est pas toujours en cause.
  4. Ajouter un test. Transformer le cas en exemple de référence avec un résultat attendu.
  5. Comparer. Rejouer ce cas et les anciens tests sur la nouvelle version.
  6. Déployer et surveiller. Versionner le changement, mesurer son effet et conserver un retour arrière.

Le NIST organise cette gestion continue autour de quatre fonctions : gouverner, cartographier, mesurer et gérer.[2]

Matrice correction → amélioration

Correction observée Cause possible Changement envisagé Test à ajouter
Échéance fausse Deux dates contradictoires Définir la source prioritaire et bloquer en cas d’écart Dossier avec deux dates différentes
Email trop affirmatif Règle de rédaction imprécise Exiger la séparation entre faits et hypothèses Brouillon avec information non confirmée
Champ CRM refusé Interprétation traitée comme un fait Passer ce champ en proposition à valider Qualification ambiguë
Pièce ignorée Source absente du périmètre Corriger la liste des documents autorisés Dossier avec annexe indispensable
Alerte inutile Seuil trop sensible Ajuster la règle métier Série de cas ordinaires proches du seuil

Exemple : après un rendez-vous commercial

L’employé IA propose une relance au 12 septembre. Le commercial la remplace par le 18. La trace montre que le compte rendu mentionnait le 12, mais que l’email reçu ensuite confirmait le 18. L’équipe décide qu’en cas de contradiction, le système doit signaler l’écart et demander une validation.

Le cas rejoint le jeu de tests. La nouvelle règle est acceptée uniquement si elle détecte cette contradiction sans bloquer les dossiers où les dates sont cohérentes.

Ce qui ne doit pas apprendre automatiquement

Les prix, remises, qualifications commerciales, destinataires d’un email et règles de conformité ne doivent pas évoluer à partir d’une correction isolée.

Une personne doit décider si le retour révèle une erreur locale ou une règle à modifier. La CNIL demande une supervision effective permettant de modifier une décision ou d’arrêter le système.[3]

Mesurer la boucle

Quatre indicateurs suffisent pour commencer :

  • taux de sorties acceptées sans correction importante ;
  • fréquence de répétition d’une même erreur ;
  • exceptions détectées avant action ;
  • régressions introduites par une nouvelle version.

La boucle progresse lorsque les erreurs utiles deviennent des tests et que les résultats s’améliorent sur des cas comparables.

La perspective Pulse

Chez Pulse, apprendre signifie rendre le système plus fiable dans une mission délimitée. L’équipe garde la décision sur les règles. Le comportement change seulement après une amélioration vérifiée et versionnée.

Le Diagnostic Pulse permet d’identifier les corrections qui méritent de devenir des règles et les cas qui doivent rester sous arbitrage humain.

Sources

[1] https://developers.openai.com/api/docs/guides/evaluation-best-practices — OpenAI, Evaluation best practices

[2] https://airc.nist.gov/airmf-resources/airmf/5-sec-core/ — NIST, AI RMF Core

[3] https://www.cnil.fr/fr/intelligence-artificielle/guide/utiliser-un-systeme-dia-en-production — CNIL, Utiliser un système d’IA en production