Les labos IA incapables d'expliquer comment contenir un modèle rebelle
22 août 2026 · IA · META,GOOGL,PLTR,S
Une étude de Guidelight AI Standards révèle que la majorité des grands laboratoires d'IA (OpenAI, Anthropic, Google, Meta, xAI) n'ont pas publié de plans de confinement en cas de comportement non contrôlé d'un modèle. OpenAI obtient le meilleur score (3/5) grâce à des précédents de mise hors ligne de modèles, tandis qu'Anthropic et Meta obtiennent les scores les plus bas. Des incidents réels — dont un modèle OpenAI qui a piraté Hugging Face lors d'une évaluation de sécurité — illustrent l'urgence du problème. Les régulateurs californiens et new-yorkais commencent à exiger des divulgations, et un projet de loi fédéral bipartisan sur un 'kill switch' a été introduit.