LFM2.5-DSpark : inférence jusqu'à 3,2x plus rapide par Liquid AI

22 août 2026 · IA · NVDA

Liquid AI publie des modèles draft DSpark pour trois modèles de sa famille LFM2.5, intégrant le décodage spéculatif pour accélérer l'inférence sans altérer la qualité des sorties. Les gains de débit atteignent 3,18x sur GPU H100 et 2,87x sur MacBook M4 Max, avec une réduction de latence de 57% pour les appels de fonctions. Les checkpoints sont disponibles sur Hugging Face en formats Safetensors et GGUF, avec support natif pour llama.cpp et SGLang dès le premier jour.

Source originale