watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

Import AI pointe les limites de l'IA en robotique et une faille OpenAI

lundi 27 juillet 202613:302 min de lecture1 source citée
L'essentiel — 3 points
  • 01MirrorCode, un benchmark d'Epoch et METR, teste la capacité des IA à reproduire des programmes logiciels complexes via CLI sans accès au code source ni à internet.
  • 02Claude Opus 4.7 et GPT-5.5 réussissent à recréer certains programmes, mais échouent sur 8 des 25 cibles à 100 % et 4 à 99 %.
  • 03Import AI signale aussi une faille de sécurité accidentelle chez OpenAI, soulignant les risques liés à l'usage non encadré de l'IA dans des environnements critiques.
Import AI pointe les limites de l'IA en robotique et une faille OpenAI

Import AI publie son numéro 466, qui analyse deux sujets distincts : les progrès et les limites persistantes de l'IA dans la programmation longue durée, ainsi qu'une faille de sécurité accidentelle découverte chez OpenAI.

Le bulletin met en avant MirrorCode, un benchmark conçu par Epoch et METR pour évaluer la capacité des modèles d'IA à reproduire des programmes logiciels complexes à partir d'un accès en ligne de commande (CLI). Ce test mesure leur aptitude à recréer intégralement un programme sans accès à son code source ni à internet, en s'appuyant uniquement sur des interactions via le terminal. Parmi les programmes cibles figurent des outils comme pkl (Apple), gotree (manipulation d'arbres phylogénétiques) ou qsv_select (sélection de colonnes CSV), couvrant entre 16 000 et 87 000 lignes de code. Les résultats montrent que des modèles comme Claude Opus 4.7 ou GPT-5.5 parviennent à reproduire certains de ces programmes, parfois en quelques heures et pour un coût d'inférence de quelques centaines de dollars. Cependant, d'autres programmes restent hors de portée : 8 des 25 cibles n'ont jamais été résolus à 100 %, et 4 autres n'ont jamais atteint 99 %. Les tâches les plus difficiles incluent un linter Python (ruff) et des bibliothèques mathématiques ou d'authentification email.

Import AI souligne que ces avancées révèlent une capacité croissante des modèles à s'orienter dans des environnements logiciels inconnus, mais rappellent aussi que les limites actuelles persistent, notamment pour les programmes les plus complexes ou spécialisés. Le benchmark, désormais publié avec 22 des 25 programmes cibles, est présenté comme un outil pour évaluer l'évolution des capacités d'autonomie des IA dans des tâches de longue haleine.

Par ailleurs, le numéro 466 évoque une faille de sécurité accidentelle identifiée chez OpenAI. Bien que les détails techniques ne soient pas divulgués dans la source, l'incident illustre les risques liés à l'intégration croissante de l'IA dans des systèmes critiques ou interconnectés. L'analyse suggère que de telles vulnérabilités pourraient émerger lors de l'utilisation non supervisée de modèles dans des environnements réels, sans garde-fous adaptés.

Réagir :
Partager —XLinkedIn
Sources citées