- 01Un *harness* optimisé permet à un modèle d’atteindre 100 % sur ARC-AGI-3, contre 30 % sans lui.
- 02Le *harness* gère mémoire, contexte et supervision, éléments clés pour les tâches de long terme.
- 03Les modèles seuls échouent souvent sur des enchaînements de décisions complexes, comme l’édition de documents ou la gestion de fichiers.

Nvidia publie des résultats de recherche indiquant que l’encadrement des agents IA, via un harness, influence davantage leurs performances que le modèle sous-jacent pour des tâches complexes.
L’étude menée par Nvidia montre qu’un harness optimisé pour la gestion de la mémoire et incluant un composant de supervision permet à un modèle comme Claude Opus 5 d’atteindre un score de 100 % sur le benchmark ARC-AGI-3, un test de raisonnement interactif. Sans ce harness, le même modèle n’obtenait que 30 %, soit le meilleur résultat parmi les modèles testés. Ces résultats soulignent que la capacité à enchaîner des décisions sur le long terme dépend moins de la puissance brute du modèle que de l’architecture qui l’encadre.
Le harness agit comme un système de contrôle pour l’agent IA, gérant la mémoire, le contexte et les retours. Adel El Hallack, vice-président produit chez Nvidia, précise que l’agent ne se limite pas au modèle lui-même : il inclut aussi l’infrastructure (scaffolding), les outils accessibles et les bibliothèques utilisées. Pour des tâches nécessitant une suite logique de décisions — comme l’édition de documents ou la gestion de fichiers — les modèles seuls échouent souvent, produisant des erreurs ou adoptant des comportements indésirables, voire dangereux.
Ces travaux rejoignent d’autres recherches récentes, comme celles de Microsoft en avril 2026, qui ont révélé que 19 grands modèles de langage échouaient systématiquement sur des tâches de long terme, générant des erreurs ou des actions inappropriées. Le benchmark ARC-AGI-3, utilisé par Nvidia, teste la capacité des modèles à résoudre des jeux 2D sans instructions, une métaphore des défis posés par les tâches complexes en conditions réelles.
Articles liés

L’Open Secure AI Alliance publie ses premières propositions pour sécuriser les agents IA
Présentation des premières mesures concrètes de l'Open Secure AI Alliance pour encadrer les agents autonomes.

NVIDIA et Hugging Face publient des données ouvertes pour entraîner les agents IA
Analyser comment un nouveau jeu de données optimise les performances des agents IA en environnement réel.

NVIDIA révolutionne l'automatisation robotique avec des agents IA autonomes
NVIDIA démontre comment des agents IA autonomes peuvent superviser l'entraînement de robots, marquant une avancée majeure vers des systèmes robotiques auto-améliorants.