watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

Inkling, le modèle multimodal de 1 000 milliards de paramètres de Thinking Machines, disponible sur Hugging Face

mercredi 15 juillet 202600:002 min de lecture1 source citée
L'essentiel — 3 points
  • 01Inkling est un modèle multimodal de 1 000 milliards de paramètres, entraîné sur 45 000 milliards de tokens texte, image et audio.
  • 02Il accepte nativement des entrées texte, image et audio avec une fenêtre de contexte de 1 million de tokens.
  • 03Disponible en BF16 et NVFP4, il est compatible avec Transformers, SGLang, vLLM et llama.cpp dès sa sortie.
Inkling, le modèle multimodal de 1 000 milliards de paramètres de Thinking Machines, disponible sur Hugging Face

Thinking Machines propose Inkling, un modèle de langage multimodal de très grande taille, désormais accessible sur Hugging Face.

Le modèle Inkling, développé par Thinking Machines, est publié sur la plateforme Hugging Face sous forme d’un modèle ouvert. Il se distingue par sa capacité à traiter simultanément des entrées de type texte, image et audio, avec une fenêtre de contexte de 1 million de tokens. Selon l’annonce, Inkling est entraîné sur 45 000 milliards de tokens couvrant ces trois modalités, ce qui en fait l’un des plus grands modèles ouverts disponibles à ce jour.

L’architecture d’Inkling repose sur un modèle de type decoder-only à mélange d’experts (Mixture-of-Experts), avec un total de 975 milliards de paramètres dont 41 milliards actifs à chaque inférence. Cette approche permet d’optimiser les performances tout en limitant la charge computationnelle. Le modèle utilise des mécanismes d’attention relative et hybride pour améliorer l’efficacité, notamment en alternant entre une attention globale et une attention par fenêtre glissante. Inkling intègre également des couches de prédiction multi-tokens (Multi Token Prediction) pour accélérer l’inférence.

Plusieurs frameworks d’inférence sont compatibles avec Inkling dès sa sortie, dont Transformers, SGLang, vLLM et llama.cpp. Deux variantes de précision sont disponibles : une version en BF16 et une version quantifiée en NVFP4, optimisée pour réduire l’empreinte mémoire. Thinking Machines met en avant les capacités de raisonnement multimodal du modèle, ainsi que sa vocation à être adapté à des domaines spécifiques via un fine-tuning.

Les premières démonstrations publiées par Thinking Machines illustrent des cas d’usage comme le codage agentique, la prédiction multi-tokens et le traitement de données multimodales. L’équipe souligne que le modèle est conçu pour servir de base à de nouvelles applications de raisonnement avancé, combinant texte, images et audio.

La publication d’Inkling s’accompagne d’un ensemble de scripts Slurm pour faciliter son déploiement, ainsi que de résultats de benchmarks pour évaluer ses performances. Thinking Machines précise que le modèle est disponible immédiatement sur Hugging Face, avec une documentation et des ressources associées.

Réagir :
Partager —XLinkedIn
Sources citées