watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

NeoMME : un encodeur multimodal multilingue open source sans tour de vision séparée

jeudi 3 septembre 202613:132 min de lecture1 source citée
L'essentiel — 3 points
  • 01NeoMME est une famille d’encodeurs multimodaux multilingues de 260M et 800M de paramètres, entraînés *from scratch* sans tour de vision séparée ni modèle de langage causal.
  • 02NeoMME-Retriever génère en un passage des embeddings denses et tardifs pour le retrieval de documents visuels, avec un débit de 51 pages/seconde (GPU NVIDIA L40S) pour le modèle 260M.
  • 03La quantification asymétrique et le *pooling* hiérarchique réduisent le stockage des index de 1,5 Mo à 6 Ko/page (255× moins) sans perte significative de performance (nDCG@10 > 95 % du baseline).
NeoMME : un encodeur multimodal multilingue open source sans tour de vision séparée

Hugging Face annonce NeoMME, une famille d’encodeurs multimodaux et multilingues de 260 millions et 800 millions de paramètres, conçus pour traiter simultanément texte et images sans recourir à une tour de vision préentraînée ni à un modèle de langage causal.

Contrairement aux approches classiques qui combinent un encodeur visuel distinct et un projetor pour aligner les modalités, NeoMME repose sur un unique Transformer bidirectionnel capable d’ingérer directement des patches d’images brutes et des tokens de texte. Le modèle est entraîné from scratch avec un objectif de diffusion discrète masquée, optimisé pour générer des représentations vectorielles unifiées. Deux variantes de taille (260M et 800M) sont proposées, toutes deux positionnées sur la frontière de Pareto ViDoRe v3 pour le score nDCG@10 et la taille du modèle.

Pour le retrieval de documents visuels, Hugging Face propose NeoMME-Retriever, une version fine-tunée exploitant l’approche page-image de ColPali. Ce modèle produit en un seul passage avant des embeddings denses et des représentations pour une interaction tardive, avec une latence réduite. À taille d’entrée d’image équivalente (2048×2048) sur un GPU NVIDIA L40S, le modèle 260M encode environ 51 pages par seconde, soit près du double du débit de ColModernVBERT. Une stratégie de pooling hiérarchique et une quantification asymétrique permettent de réduire le stockage des index pour l’interaction tardive de 1,5 Mo à 6 Ko par page (255 fois moins), tout en conservant plus de 95 % du score nDCG@10 de référence.

Disponible via Hugging Face Transformers, NeoMME est distribué sous licence Apache 2.0, avec l’ensemble des poids et des outils associés (démos, rapports techniques) accessibles dans une collection dédiée. L’objectif affiché est de proposer une alternative légère aux architectures VLM traditionnelles, en éliminant les surcoûts computationnels et paramétriques liés aux tours de vision séparées ou aux décodeurs causaux.

Réagir :
Partager —XLinkedIn
Sources citées