Corriger une sortie ne suffit pas à améliorer un employé IA.
Si la correction d’une échéance, d’un email ou d’une qualification disparaît après validation, le système peut répéter l’erreur. Si elle modifie immédiatement son comportement, une préférence isolée peut devenir une règle dangereuse. La boucle utile conserve le signal, cherche sa cause et teste le changement avant déploiement.
Une correction n’est pas encore un apprentissage
Une sortie peut être mauvaise à cause d’une source incomplète, d’une donnée erronée, d’une règle ambiguë, d’un outil mal appelé ou d’un cas exceptionnel. Changer le prompt à chaque erreur mélange ces causes.
OpenAI recommande des évaluations propres à la tâche, alimentées par des cas réels et calibrées avec du jugement humain, plutôt qu’une appréciation vague du type « cela semble fonctionner ».[1]
La boucle d’apprentissage Pulse
- Observer. Conserver l’entrée, les sources utilisées, la sortie proposée et la correction humaine.
- Qualifier. Classer l’écart : donnée, règle, permission, outil, format ou exception.
- Corriger la bonne couche. Modifier la source, l’instruction, le workflow ou le périmètre d’accès. Le modèle n’est pas toujours en cause.
- Ajouter un test. Transformer le cas en exemple de référence avec un résultat attendu.
- Comparer. Rejouer ce cas et les anciens tests sur la nouvelle version.
- Déployer et surveiller. Versionner le changement, mesurer son effet et conserver un retour arrière.
Le NIST organise cette gestion continue autour de quatre fonctions : gouverner, cartographier, mesurer et gérer.[2]
Matrice correction → amélioration
| Correction observée | Cause possible | Changement envisagé | Test à ajouter |
|---|---|---|---|
| Échéance fausse | Deux dates contradictoires | Définir la source prioritaire et bloquer en cas d’écart | Dossier avec deux dates différentes |
| Email trop affirmatif | Règle de rédaction imprécise | Exiger la séparation entre faits et hypothèses | Brouillon avec information non confirmée |
| Champ CRM refusé | Interprétation traitée comme un fait | Passer ce champ en proposition à valider | Qualification ambiguë |
| Pièce ignorée | Source absente du périmètre | Corriger la liste des documents autorisés | Dossier avec annexe indispensable |
| Alerte inutile | Seuil trop sensible | Ajuster la règle métier | Série de cas ordinaires proches du seuil |
Exemple : après un rendez-vous commercial
L’employé IA propose une relance au 12 septembre. Le commercial la remplace par le 18. La trace montre que le compte rendu mentionnait le 12, mais que l’email reçu ensuite confirmait le 18. L’équipe décide qu’en cas de contradiction, le système doit signaler l’écart et demander une validation.
Le cas rejoint le jeu de tests. La nouvelle règle est acceptée uniquement si elle détecte cette contradiction sans bloquer les dossiers où les dates sont cohérentes.
Ce qui ne doit pas apprendre automatiquement
Les prix, remises, qualifications commerciales, destinataires d’un email et règles de conformité ne doivent pas évoluer à partir d’une correction isolée.
Une personne doit décider si le retour révèle une erreur locale ou une règle à modifier. La CNIL demande une supervision effective permettant de modifier une décision ou d’arrêter le système.[3]
Mesurer la boucle
Quatre indicateurs suffisent pour commencer :
- taux de sorties acceptées sans correction importante ;
- fréquence de répétition d’une même erreur ;
- exceptions détectées avant action ;
- régressions introduites par une nouvelle version.
La boucle progresse lorsque les erreurs utiles deviennent des tests et que les résultats s’améliorent sur des cas comparables.
La perspective Pulse
Chez Pulse, apprendre signifie rendre le système plus fiable dans une mission délimitée. L’équipe garde la décision sur les règles. Le comportement change seulement après une amélioration vérifiée et versionnée.
Le Diagnostic Pulse permet d’identifier les corrections qui méritent de devenir des règles et les cas qui doivent rester sous arbitrage humain.
Sources
[1] https://developers.openai.com/api/docs/guides/evaluation-best-practices — OpenAI, Evaluation best practices
[2] https://airc.nist.gov/airmf-resources/airmf/5-sec-core/ — NIST, AI RMF Core
[3] https://www.cnil.fr/fr/intelligence-artificielle/guide/utiliser-un-systeme-dia-en-production — CNIL, Utiliser un système d’IA en production