Élagage de LLMs via optimisation Ising : gains massifs sur Llama-70B

21 septembre 2026 · IA · IONQ,QBTS,RGTI

Des chercheurs de Multiverse Computing reformulent la suppression de blocs dans les LLMs comme un problème d'optimisation binaire contrainte, équivalent à un verre d'Ising. Cette approche capture les interactions entre blocs (couplages many-body) ignorées par les méthodes classiques. À 50% de compression de Llama-3.3-70B-Instruct, la méthode gagne près de 23 points de pourcentage sur MMLU par rapport aux meilleures méthodes concurrentes. La méthode est compatible avec des solveurs quantiques et quasi-quantiques, domaine d'expertise de Multiverse Computing.

Impact marchés

Secteur IA/compression de modèles : bénéficie aux fournisseurs d'inférence et cloud (AWS, Google, Azure). Multiverse Computing positionné sur l'optimisation quantique appliquée à l'IA. Tendance à la compression agressive des LLMs pour réduire les coûts d'inférence.

Opportunités

Opportunité pour les acteurs du calcul quantique et quasi-quantique (D-Wave, IonQ) si la méthode se généralise. Risque : la méthode reste une recherche académique sans déploiement commercial confirmé. Avantage concurrentiel potentiel pour Multiverse Computing sur le marché de la compression LLM.

Source originale