ZML lance ZML/LLMD, un serveur d'inférence gratuit compatible avec plusieurs puces IA
- 01ZML a lancé ZML/LLMD, un serveur d'inférence gratuit compatible avec les puces Nvidia, AMD, Google TPU, Apple Metal et Intel Arc.
- 02L'outil vise à réduire le verrouillage fournisseur et permettre aux entreprises de choisir des puces selon les coûts et la consommation énergétique.
- 03ZML, startup parisienne de 20 personnes soutenue par Yann LeCun, entre en concurrence avec Baseten, Inferact et RadixArk sur le marché de l'inférence.

La startup française ZML a publié ZML/LLMD, un logiciel d'inférence open source permettant aux modèles de langage de fonctionner sur diverses architectures matérielles : puces Nvidia, AMD, TPU de Google, Apple Metal et Intel Arc. L'objectif affiché est de réduire la dépendance aux solutions propriétaires et d'offrir aux entreprises la flexibilité de choisir leurs puces en fonction des coûts et de la consommation énergétique.
Selon Steeve Morin, fondateur de ZML, l'optimisation de l'inférence — le traitement des requêtes utilisateur — est devenue aussi critique que l'entraînement des modèles, mais reste fragmentée par des barrières logicielles et architecturales créant un verrouillage fournisseur. ZML/LLMD entend briser ces silos en permettant aux entreprises et aux fournisseurs cloud d'utiliser un mélange de puces, potentiellement moins coûteuses ou consommant moins d'énergie. La startup, soutenue par le lauréat du prix Turing Yann LeCun, compte une équipe de 20 personnes basée à Paris.
Cette approche multi-architectures pourrait bénéficier aux fabricants de puces IA émergents, notamment européens, que Morin cite comme Axelera, Fractile, Kalray, OLIX, Q.ANT, SiPearl, SpiNNcloud et VSORA. ZML affirme maintenir une bonne relation avec Nvidia malgré cette ambition de diversification. Le marché de l'inférence attire déjà plusieurs acteurs : Baseten (valorisée à 13 milliards de dollars), Inferact (créée par les auteurs du projet open source vLLM), et RadixArk (société commerciale derrière SGLang). Morin indique que ZML envisage une portée plus large, incluant la co-conception de silicium avec ses partenaires.
