Inkling, le modèle multimodal de 1 000 milliards de paramètres de Thinking Machines, disponible sur Hugging Face
- 01Inkling est un modèle multimodal de 1 000 milliards de paramètres, entraîné sur 45 000 milliards de tokens texte, image et audio.
- 02Il accepte nativement des entrées texte, image et audio avec une fenêtre de contexte de 1 million de tokens.
- 03Disponible en BF16 et NVFP4, il est compatible avec Transformers, SGLang, vLLM et llama.cpp dès sa sortie.
Thinking Machines propose Inkling, un modèle de langage multimodal de très grande taille, désormais accessible sur Hugging Face.
Le modèle Inkling, développé par Thinking Machines, est publié sur la plateforme Hugging Face sous forme d’un modèle ouvert. Il se distingue par sa capacité à traiter simultanément des entrées de type texte, image et audio, avec une fenêtre de contexte de 1 million de tokens. Selon l’annonce, Inkling est entraîné sur 45 000 milliards de tokens couvrant ces trois modalités, ce qui en fait l’un des plus grands modèles ouverts disponibles à ce jour.
L’architecture d’Inkling repose sur un modèle de type decoder-only à mélange d’experts (Mixture-of-Experts), avec un total de 975 milliards de paramètres dont 41 milliards actifs à chaque inférence. Cette approche permet d’optimiser les performances tout en limitant la charge computationnelle. Le modèle utilise des mécanismes d’attention relative et hybride pour améliorer l’efficacité, notamment en alternant entre une attention globale et une attention par fenêtre glissante. Inkling intègre également des couches de prédiction multi-tokens (Multi Token Prediction) pour accélérer l’inférence.
Plusieurs frameworks d’inférence sont compatibles avec Inkling dès sa sortie, dont Transformers, SGLang, vLLM et llama.cpp. Deux variantes de précision sont disponibles : une version en BF16 et une version quantifiée en NVFP4, optimisée pour réduire l’empreinte mémoire. Thinking Machines met en avant les capacités de raisonnement multimodal du modèle, ainsi que sa vocation à être adapté à des domaines spécifiques via un fine-tuning.
Les premières démonstrations publiées par Thinking Machines illustrent des cas d’usage comme le codage agentique, la prédiction multi-tokens et le traitement de données multimodales. L’équipe souligne que le modèle est conçu pour servir de base à de nouvelles applications de raisonnement avancé, combinant texte, images et audio.
La publication d’Inkling s’accompagne d’un ensemble de scripts Slurm pour faciliter son déploiement, ainsi que de résultats de benchmarks pour évaluer ses performances. Thinking Machines précise que le modèle est disponible immédiatement sur Hugging Face, avec une documentation et des ressources associées.
Articles liés

Thinking Machines publie Inkling, son premier modèle open source
Découvrez Inkling, le premier modèle open source de Thinking Machines, conçu pour contrer les approches IA standardisées.

L'incident Hugging Face d'OpenAI relance le débat sur l'alignement et le contrôle des modèles
Les experts discutent des solutions à privilégier pour limiter les risques liés aux modèles d'IA après l'incident.

OpenAI admet une faille de sécurité ayant permis une intrusion sur Hugging Face
Décrypter les risques de sécurité liés aux agents IA autonomes et leurs conséquences sur les plateformes open source.