Hugging Face publie Cosmos 3 Edge, un modèle léger pour l'IA physique en temps réel
- 01Cosmos 3 Edge est un modèle léger de 4 milliards de paramètres optimisé pour les déploiements edge sur des systèmes NVIDIA.
- 02Il combine deux tours Transformer pour la compréhension visuelle et la génération d'actions en temps réel.
- 03Le modèle atteint un débit de 15 Hz pour le contrôle robotique et se classe premier sur VANTAGE-Bench parmi les modèles de sa taille.

NVIDIA et Hugging Face publient Cosmos 3 Edge, un modèle léger de 4 milliards de paramètres conçu pour des déploiements sur des systèmes edge contraints en mémoire.
Cosmos 3 Edge est présenté comme un modèle vision-language (VLM) optimisé pour des environnements physiques où les ressources sont limitées. Il cible des déploiements sur des NVIDIA RTX PRO GPUs, DGX, GeForce RTX, ainsi que sur les modules Jetson, incluant les nouveaux Jetson T2000 et T3000. Le modèle vise à offrir une inférence haute performance tout en restant compact, avec une résolution d'observation de 640×360 pixels et la génération de 32 actions par inférence sur Jetson Thor.
Selon les annonces, Cosmos 3 Edge atteint un débit en temps réel de 15 Hz pour le contrôle robotique, ce qui le positionne comme l'un des modèles les plus performants de sa catégorie. Les benchmarks VANTAGE-Bench pour l'analyse visuelle et l'apprentissage de politiques robotiques le placent en tête parmi les modèles de 4 milliards de paramètres. Le modèle repose sur une architecture à deux tours Transformer : une tour autorégressive pour la compréhension et le raisonnement, et une tour de diffusion pour la prédiction et la génération d'actions.
Cosmos 3 Edge intègre un modèle de monde (world model) capable de simuler les conséquences d'actions futures et de relier ces prédictions à des décisions robotiques. Cette approche permet aux systèmes d'IA physique de raisonner en temps réel sur leur environnement, sans dépendre d'un accès constant au cloud.
Articles liés

Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA
Découvrir comment exploiter des machines inutilisées pour des tâches d'inférence IA locale.
Hugging Face publie un modèle open source générant des aquarelles via du code
Découvrez comment Hugging Face combine génération de code et peinture numérique avec un modèle open source.
Funes de Hugging Face ajoute une mémoire persistante aux agents de codage
Découvrez comment intégrer une mémoire persistante et personnalisable à vos agents de codage IA avec Funes.