watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

Des modèles d'IA capables de recherche scientifique autonome émergent

lundi 17 août 202613:052 min de lecture1 source citée
L'essentiel — 3 points
  • 01DiG-bench évalue la capacité des IA à découvrir des règles cachées dans des environnements interactifs via 70 jeux textuels.
  • 02Seuls Opus 5 et Fable 5 ont réussi des tâches dans le niveau le plus difficile, avec un taux de réussite de 0,2 %.
  • 03Les jeux, conçus par des experts et majoritairement privés, visent à mesurer l’autonomie des modèles dans la recherche scientifique.
Des modèles d'IA capables de recherche scientifique autonome émergent

Des chercheurs développent des systèmes d’intelligence artificielle capables de mener des recherches scientifiques de manière autonome, une avancée présentée comme une nouvelle frontière pour l’IA.

Une équipe internationale, incluant des membres de l’University of Oxford, de Princeton University, du MIT et d’autres institutions, a conçu DiG-bench (Discovery in Games), un benchmark de 70 jeux conçus pour évaluer la capacité des modèles à découvrir des règles cachées dans des environnements interactifs. Chaque jeu représente un « mini-monde » autonome, avec ses propres lois et objectifs non révélés, que l’IA doit déduire par exploration et interaction. L’objectif est de mesurer la capacité des systèmes à identifier les mécanismes déterminants pour réussir, une compétence cruciale pour l’innovation scientifique.

Les jeux, entièrement textuels, sont adaptés aux modèles de langage actuels, avec des traces suffisamment courtes pour tenir dans leurs fenêtres de contexte. Ils ont été conçus par des experts humains et majoritairement gardés privés pour éviter que les modèles ne s’entraînent dessus. Bien que certains aient été résolus par des humains, leur difficulté reste élevée : seuls Opus 5 et Fable 5 ont réussi à accomplir des tâches dans le niveau le plus complexe (Tier 7), avec un taux de réussite de 0,2 %. Les modèles évalués incluent Opus 5, Fable 5, GPT-5.5 et Claude Code, mais aucun n’a encore démontré une maîtrise généralisée de ces environnements.

Cette avancée souligne le potentiel des modèles d’IA à explorer des hypothèses, tester des scénarios et formuler des conclusions sans intervention humaine directe, ce qui pourrait accélérer la recherche dans des domaines comme la physique théorique, la biologie ou la chimie computationnelle.

Réagir :
Partager —XLinkedIn
Sources citées