IBM Research : mesurer et corriger l'incohérence des agents IA
15 septembre 2026 · IA · IBM
IBM Research publie une analyse sur l'incohérence des agents IA en production, révélant un écart de 24,4 points entre le taux de succès moyen (77,4%) et le taux de succès systématique (53,0%) sur le benchmark AppWorld avec GPT-4.1. L'équipe introduit le 'Consistency Analyzer', un outil diagnostique qui identifie les points de décision instables dans les trajectoires d'agents sans nécessiter de ground truth. En générant des 'consistency guidelines' injectées à l'inférence, IBM réduit cet écart de moitié (de 24,4pp à 12,0pp) sans dégrader la précision moyenne.
Impact marchés
Marché de l'IA agentique et des LLM en production (IBM, OpenAI/GPT-4.1). Concerne les éditeurs de solutions d'automatisation d'entreprise et les intégrateurs d'agents IA pour workflows critiques (finance, légal, conformité).
Opportunités
Opportunité pour les acteurs proposant des outils d'observabilité et de fiabilité des agents IA (MLOps, AIOps). Risque pour les entreprises ayant déployé des agents sans mesure de consistance, notamment dans des processus critiques. IBM renforce sa position différenciée sur l'IA d'entreprise fiable.