L'alignement des IA superintelligentes reste incertain selon des chercheurs
- 01Sequent, une nouvelle organisation à but non lucratif, est créée pour développer des techniques d’alignement des IA superintelligentes jugées insuffisantes par ses fondateurs.
- 02L’approche de Sequent mise sur une recherche diversifiée combinant théorie et empirie, avec un financement initial de 100 à 150 millions de dollars.
- 03Les risques de reward hacking et d’auto-amélioration récursive des IA soulignent l’urgence d’avancer sur des méthodes d’alignement robustes.

Des chercheurs du UK AI Security Institute et de la startup Timaeus lancent Sequent, une organisation à but non lucratif dédiée à l’alignement des IA superintelligentes. Leur constat : les techniques actuelles ne garantissent pas une confiance suffisante avant le déploiement de systèmes superintelligents, potentiellement développés dans les prochaines années.
Sequent se positionne comme une alternative aux approches des grands laboratoires d’IA, jugées réactives et limitées à des méthodes sans garantie théorique de généralisation. L’organisation propose une stratégie de recherche diversifiée, combinant théorie et empirie, avec des axes comme la supervision scalable, la théorie de l’apprentissage, les arguments heuristiques, la théorie des jeux et les personas. L’objectif est de trouver des raisons principielles pour lesquelles l’alignement observé en conditions contrôlées (entraînement, évaluations) pourrait s’étendre à des scénarios non maîtrisés, comme des tâches à long terme dans le monde réel.
Le financement initial visé par Sequent s’élève à 100–150 millions de dollars, avec une préparation pour lever jusqu’à dix fois plus si les recherches parallèles s’avèrent prometteuses. L’organisation prévoit d’atteindre 40 à 80 employés à temps plein d’ici quelques années. Leur approche repose sur l’exploration de multiples paris de recherche pour identifier des interactions entre disciplines, comme l’étude des équilibres atteignables en supervision scalable ou l’ajustement des paramètres d’entraînement via des combinaisons de théorie de l’apprentissage et de personas.
Parallèlement, les débats sur les risques liés à l’alignement persistent. Les travaux récents soulignent notamment le reward hacking, où des systèmes contournent leurs objectifs initiaux de manière imprévue, ainsi que les défis posés par l’auto-amélioration récursive des IA. Ces enjeux renforcent l’urgence d’avancer sur des méthodes d’alignement robustes et vérifiables avant que des systèmes superintelligents ne deviennent une réalité opérationnelle.
Articles liés

Meta publie Glimmer, un modèle IA open-weight pour des agents personnels locaux
Décryptage des ambitions de Meta en IA ouverte et de la vision de Mark Zuckerberg sur la superintelligence personnelle.

Les limites des agents IA spécialisés dans la coordination multi-domaines
Découvrir les limites actuelles des agents IA autonomes dans des scénarios multi-domaines.

Alexandre LeBrun (AMI Labs) rejette les termes AGI et superintelligence
Le PDG d'AMI Labs, lié à Yann LeCun, critique l'usage des termes AGI et superintelligence dans le secteur.