watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

ZML lance ZML/LLMD, un serveur d'inférence gratuit compatible avec plusieurs puces IA

mercredi 8 juillet 202608:002 min de lecture1 source citée
L'essentiel — 3 points
  • 01ZML a lancé ZML/LLMD, un serveur d'inférence gratuit compatible avec les puces Nvidia, AMD, Google TPU, Apple Metal et Intel Arc.
  • 02L'outil vise à réduire le verrouillage fournisseur et permettre aux entreprises de choisir des puces selon les coûts et la consommation énergétique.
  • 03ZML, startup parisienne de 20 personnes soutenue par Yann LeCun, entre en concurrence avec Baseten, Inferact et RadixArk sur le marché de l'inférence.
ZML lance ZML/LLMD, un serveur d'inférence gratuit compatible avec plusieurs puces IA

La startup française ZML a publié ZML/LLMD, un logiciel d'inférence open source permettant aux modèles de langage de fonctionner sur diverses architectures matérielles : puces Nvidia, AMD, TPU de Google, Apple Metal et Intel Arc. L'objectif affiché est de réduire la dépendance aux solutions propriétaires et d'offrir aux entreprises la flexibilité de choisir leurs puces en fonction des coûts et de la consommation énergétique.

Selon Steeve Morin, fondateur de ZML, l'optimisation de l'inférence — le traitement des requêtes utilisateur — est devenue aussi critique que l'entraînement des modèles, mais reste fragmentée par des barrières logicielles et architecturales créant un verrouillage fournisseur. ZML/LLMD entend briser ces silos en permettant aux entreprises et aux fournisseurs cloud d'utiliser un mélange de puces, potentiellement moins coûteuses ou consommant moins d'énergie. La startup, soutenue par le lauréat du prix Turing Yann LeCun, compte une équipe de 20 personnes basée à Paris.

Cette approche multi-architectures pourrait bénéficier aux fabricants de puces IA émergents, notamment européens, que Morin cite comme Axelera, Fractile, Kalray, OLIX, Q.ANT, SiPearl, SpiNNcloud et VSORA. ZML affirme maintenir une bonne relation avec Nvidia malgré cette ambition de diversification. Le marché de l'inférence attire déjà plusieurs acteurs : Baseten (valorisée à 13 milliards de dollars), Inferact (créée par les auteurs du projet open source vLLM), et RadixArk (société commerciale derrière SGLang). Morin indique que ZML envisage une portée plus large, incluant la co-conception de silicium avec ses partenaires.

Réagir :
Partager —XLinkedIn
Sources citées