watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
29 aoûtSony Music et Warner Chappell attaquent Anthropic pour violation de droits d'auteur·29 aoûtVijay Pande quitte a16z pour fonder VZVC, une structure ciblée en IA médicale·29 aoûtNvidia étend son avantage IA avec des systèmes d'orchestration pour centres de données·29 aoûtLes musiciens traquent l'utilisation non déclarée d'œuvres pour l'IA générative musicale·28 aoûtNeocloud Lambda lève 1 milliard de dollars de dette pour financer des puces Nvidia·28 aoûtAnthropic démontre l’auto-amélioration contrôlée d’une IA par un système automatisé·28 aoûtLes acquisitions ciblent les acteurs de l’IA open source pour contrôler les modèles·28 aoûtUn juge fédéral annule le blacklistage d'Anthropic par l'administration Trump·28 aoûtL’EPA américaine supprime l’obligation de consultation publique pour les permis de pollution des data centers·28 aoûtMicroduck, un robot humanoïde open source de 25 cm à 399 $·29 aoûtSony Music et Warner Chappell attaquent Anthropic pour violation de droits d'auteur·29 aoûtVijay Pande quitte a16z pour fonder VZVC, une structure ciblée en IA médicale·29 aoûtNvidia étend son avantage IA avec des systèmes d'orchestration pour centres de données·29 aoûtLes musiciens traquent l'utilisation non déclarée d'œuvres pour l'IA générative musicale·28 aoûtNeocloud Lambda lève 1 milliard de dollars de dette pour financer des puces Nvidia·28 aoûtAnthropic démontre l’auto-amélioration contrôlée d’une IA par un système automatisé·28 aoûtLes acquisitions ciblent les acteurs de l’IA open source pour contrôler les modèles·28 aoûtUn juge fédéral annule le blacklistage d'Anthropic par l'administration Trump·28 aoûtL’EPA américaine supprime l’obligation de consultation publique pour les permis de pollution des data centers·28 aoûtMicroduck, un robot humanoïde open source de 25 cm à 399 $·29 aoûtSony Music et Warner Chappell attaquent Anthropic pour violation de droits d'auteur·29 aoûtVijay Pande quitte a16z pour fonder VZVC, une structure ciblée en IA médicale·29 aoûtNvidia étend son avantage IA avec des systèmes d'orchestration pour centres de données·29 aoûtLes musiciens traquent l'utilisation non déclarée d'œuvres pour l'IA générative musicale·28 aoûtNeocloud Lambda lève 1 milliard de dollars de dette pour financer des puces Nvidia·28 aoûtAnthropic démontre l’auto-amélioration contrôlée d’une IA par un système automatisé·28 aoûtLes acquisitions ciblent les acteurs de l’IA open source pour contrôler les modèles·28 aoûtUn juge fédéral annule le blacklistage d'Anthropic par l'administration Trump·28 aoûtL’EPA américaine supprime l’obligation de consultation publique pour les permis de pollution des data centers·28 aoûtMicroduck, un robot humanoïde open source de 25 cm à 399 $·29 aoûtSony Music et Warner Chappell attaquent Anthropic pour violation de droits d'auteur·29 aoûtVijay Pande quitte a16z pour fonder VZVC, une structure ciblée en IA médicale·29 aoûtNvidia étend son avantage IA avec des systèmes d'orchestration pour centres de données·29 aoûtLes musiciens traquent l'utilisation non déclarée d'œuvres pour l'IA générative musicale·28 aoûtNeocloud Lambda lève 1 milliard de dollars de dette pour financer des puces Nvidia·28 aoûtAnthropic démontre l’auto-amélioration contrôlée d’une IA par un système automatisé·28 aoûtLes acquisitions ciblent les acteurs de l’IA open source pour contrôler les modèles·28 aoûtUn juge fédéral annule le blacklistage d'Anthropic par l'administration Trump·28 aoûtL’EPA américaine supprime l’obligation de consultation publique pour les permis de pollution des data centers·28 aoûtMicroduck, un robot humanoïde open source de 25 cm à 399 $·

LFM2.5-DSpark accélère jusqu’à 3,2 fois l’inférence des modèles LiquidAI

jeudi 20 août 202616:522 min de lecture1 source citée
L'essentiel — 1 point
  • 01LFM2.5-DSpark utilise un décodage spéculatif avec des drafts légers pour accélérer l'inférence jusqu'à 3,2 fois sur certains modèles LiquidAI.
LFM2.5-DSpark accélère jusqu’à 3,2 fois l’inférence des modèles LiquidAI

LFM2.5-DSpark, une extension open source de la famille de modèles LiquidAI, améliore jusqu’à 3,2 fois la vitesse d’inférence pour certains cas d’usage, sans altérer la qualité des réponses générées.

L’outil introduit un mécanisme de décodage spéculatif via des modèles draft légers, intégrés aux modèles LFM2.5-1.2B-Instruct, LFM2.5-2.6B et LFM2.5-8B-A1B. Ces drafts, composés de 5 couches d’attention et d’une tête séquentielle Markov, génèrent des tokens candidats en parallèle. Le modèle cible vérifie ensuite l’ensemble des candidats en une seule passe, réduisant le temps de chargement des poids en mémoire. Les gains mesurés atteignent jusqu’à 3,18 fois sur GPU et 2,87 fois sur appareil mobile, avec une baisse moyenne de 57 % de la latence pour les appels de fonctions avec LFM2.5-2.6B.

L’architecture repose sur trois composants : un backbone parallèle inspiré de DFlash, conditionné par les features du modèle cible ; une tête séquentielle Markov pour renforcer la cohérence des tokens ; et un verificateur à confiance calibrée qui élimine les suffixes peu probables avant vérification. Les drafts, formés sur un mélange de données SFT, chat, code et function-calling, comptent environ 300 millions de paramètres chacun. Leur entraînement privilégie le taux d’acceptation plutôt que la perte, avec 15 époques par version.

L’intégration est immédiate pour llama.cpp et SGLang, via des checkpoints compatibles LFM et open sourcés en amont. La solution cible principalement les environnements où la mémoire est un goulot d’étranglement, comme les déploiements sur appareil ou les inférences à haut débit.

Réagir :
Partager —XLinkedIn
Sources citées