Nvidia change la donne avec son harness pour agents IA

Nvidia affirme qu’un bon “harness” peut changer la donne pour les agents IA. Ses tests montrent un écart massif, en précision comme en coûts.

Nvidia
Image d'illustration. Nvidia — Nvidia / PR-ADN

En bref

  • Nvidia booste Claude Opus 5 avec son harness AVO.
  • Mémoire, contexte et superviseur renforcent l’agent.
  • Le bon harness pourrait devenir aussi important que le modèle.

Le chiffre claque. Avec un harness maison, Nvidia dit avoir fait passer Claude Opus 5 de 30% à 100% sur ARC-AGI-3, un benchmark de raisonnement interactif. Sans cet habillage technique, le même modèle signait déjà le meilleur score du lot testé, mais il restait loin du sans-faute.

Un même modèle, mais un score qui explose

Le test choisi n’a rien d’anodin. ARC-AGI-3 repose sur une série de jeux 2D sans consignes, où l’IA doit comprendre seule comment jouer puis gagner. Pour Nvidia, obtenir 100% revient à atteindre un niveau comparable à celui d’un humain sur ce banc d’essai.

Ce résultat intéresse aussi parce que ce benchmark a déjà mis en difficulté OpenAI. Ses modèles y étaient tombés sous les 10%. Le mois dernier, l’entreprise a d’ailleurs indiqué avoir elle aussi amélioré ses scores en modifiant seulement deux réglages du harness. Mais pas au point d’atteindre le score annoncé par Nvidia.

Ce que recouvre vraiment le mot harness

Pour Adel El Hallack, vice-président produit de l’unité IA de Nvidia, on réduit trop souvent un agent à une simple API de modèle. Il explique qu’un agent, c’est aussi la structure autour du modèle, les outils qu’il utilise, le runtime, ainsi que les compétences et bibliothèques auxquelles on lui donne accès.

En gros, le harness gère la mémoire, le contexte et les retours. C’est lui qui transforme un modèle en agent, surtout quand il faut enchaîner des décisions sur une longue durée.

Pourquoi les tâches longues restent le vrai mur ?

Les tâches dites long-horizon demandent de lier plusieurs décisions, parfois sur plusieurs jours, pour produire un travail fini. On n’est plus dans la simple réponse à un prompt.

Et c’est là que ça coince souvent. En avril, Microsoft a testé 19 grands modèles de langage sur des tâches longues d’édition de documents. Résultat, tous ont ajouté des erreurs dans les fichiers, y compris les modèles les plus avancés. D’autres agents ont aussi été surpris en train de supprimer des fichiers utilisateur, voire des bases de données entières, ou d’adopter des comportements allant jusqu’à la collusion et au piratage pour atteindre leur but.

Le rôle clé d’un superviseur dans la boucle

Le point qui a le plus compté, selon Adel El Hallack, n’est pas seulement l’amélioration de la mémoire. Nvidia a ajouté un agent superviseur, une sorte de chef d’orchestre chargé de remettre l’agent principal sur les rails quand il s’égare ou s’enferme dans une impasse.

Ce composant n’est pas nouveau sur le principe. Mais beaucoup d’utilisateurs s’appuient encore sur une seule couche de harness, avec des outils comme Claude Code, Codex ou Hermes. Les chercheurs de Nvidia ont, eux, construit leur propre système, baptisé Agentic Variation Operators, ou AVO.

Derrière la performance, un enjeu d’ouverture et de coûts

Nvidia précise qu’AVO n’est pas un nouveau produit. L’entreprise propose déjà, sous la marque Nemo, de nombreuses briques pour construire ces systèmes, certaines commerciales, beaucoup ouvertes.

Ce débat ne porte pas seulement sur la précision. En juillet, Databricks a publié des travaux montrant que le choix du harness peut aussi peser lourd sur les coûts. Son patron, Ali Ghodsi, a expliqué qu’avec le même modèle, un mauvais harness pouvait pratiquement doubler la facture.

La ligne de Nvidia est claire. Des harness ouverts, comme les modèles ouverts, donnent plus de contrôle aux utilisateurs, sur l’infrastructure, le runtime et la sécurité. Un sujet qui revient alors que OpenAI a ralenti l’entraînement de ses modèles après des problèmes de sécurité signalés en interne.

Jordan Servan

Spécialiste Tech

X LinkedIn Tous ses articles →
Une erreur dans cet article ?

Nous apportons le plus grand soin à chaque article et nous appuyons sur des sources fiables. Personne n'est à l'abri d'une erreur : si vous en repérez une, signalez-la, nous la corrigerons au plus vite.

Sujets
Agent IA Nvidia

Lisez 24matins en priorité sur Google

Ajoutez-nous à vos sources préférées : nos articles remonteront plus haut dans votre actualité.

Ajouter à mes sources

À découvrir

La suite, sélectionnée pour vous.