watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

NousCoder-14B : un modèle open source de programmation rival des outils propriétaires

mercredi 7 janvier 202620:002 min de lecture1 source citée
L'essentiel — 3 points
  • 01NousCoder-14B, modèle open source de Nous Research, affiche 67,87 % de précision sur LiveCodeBench v6, soit +7,08 points vs son modèle de base Qwen3-14B d’Alibaba.
  • 02Le modèle est publié avec son environnement d’entraînement complet (Atropos), permettant une reproduction ouverte par la communauté.
  • 03L’entraînement utilise 24 000 problèmes de programmation compétitive avec des récompenses vérifiables, exécutés en sandbox sur Modal.
NOUS_RESEARCH

Nous Research publie NousCoder-14B, un modèle open source de programmation qui revendique des performances comparables ou supérieures à des outils propriétaires comme Claude Code, dans un contexte marqué par l’essor des assistants IA pour le développement logiciel.

Le modèle, entraîné en quatre jours sur 48 GPU Nvidia B200, atteint un taux de précision de 67,87 % sur LiveCodeBench v6, un benchmark évaluant la résolution de problèmes de programmation compétitive publiés entre août 2024 et mai 2025. Ce résultat représente une amélioration de 7,08 points de pourcentage par rapport à son modèle de base, Qwen3-14B d’Alibaba, selon le rapport technique de Nous Research. L’annonce intervient alors que Claude Code, l’outil d’Anthropic, suscite un engouement croissant depuis le début de l’année, avec des témoignages de développeurs mettant en avant ses capacités à générer des systèmes logiciels complexes à partir de descriptions succinctes.

NousCoder-14B se distingue par son approche radicalement ouverte : Nous Research publie non seulement les poids du modèle, mais aussi l’environnement complet de renforcement, la suite de benchmarks et l’infrastructure de entraînement (Atropos), permettant à quiconque disposant de ressources de calcul suffisantes de reproduire ou d’étendre le travail. Cette transparence vise à répondre à des enjeux de reproductibilité et de recherche académique, notamment dans le domaine du raisonnement de haut niveau. Le modèle a été entraîné par Joe Li, chercheur chez Nous Research et ancien programmeur compétitif, qui souligne dans son rapport une amélioration équivalente à un gain de plusieurs centaines de points sur Codeforces en seulement quatre jours de calcul — un progrès qui prendrait des années à un humain.

L’entraînement repose sur un système de récompenses vérifiables : le modèle génère des solutions de code, exécutées contre des cas de test, et reçoit un signal binaire (correct ou incorrect). Cette méthode nécessite une infrastructure lourde, avec 24 000 problèmes traités et des centaines de cas de test par problème, exécutés dans des environnements sandboxés (15 secondes et 4 Go de mémoire maximum). L’utilisation de Modal, une plateforme cloud, a permis de paralléliser ces exécutions à grande échelle. Joe Li note cependant que le modèle a nécessité 24 000 problèmes pour atteindre ce niveau, contre environ 1 000 pour un humain, soulignant la différence actuelle d’efficacité d’apprentissage entre IA et humains.

Réagir :
Partager —XLinkedIn
Sources citées