List of Best

Le nouveau système AVO de NVIDIA montre que les outils d'agents comptent plus que les simples modèles bruts

Sommaire
Editorial illustration for: NVIDIA's New AVO System Shows Agent Tools Matter More Than Just Raw Models
Illustration by AI

NVIDIA a dévoilé AVO, un système d’agents conçu pour gérer des tâches de programmation longues et complexes. Si vous développez avec l’IA, cela montre que les outils et les boucles de rétroaction comptent tout autant que la puissance brute des modèles.

Comment fonctionne le système

AVO signifie Agentic Variation Operators. Au lieu de donner une seule réponse et de s’arrêter, le système fonctionne selon une boucle continue. Il inspecte les tâches, teste le code, vérifie les retours de l’environnement et utilise une mémoire persistante pour corriger les erreurs. Le système ne s’arrête pas.

NVIDIA a partagé deux résultats de test majeurs sur le NVIDIA Technical Blog :

  • Optimisation de kernels GPU. AVO a exploré plus de 500 pistes et validé 40 versions de kernels. Il a fonctionné jusqu’à 10.5% plus vite que FlashAttention-4 sur des systèmes NVIDIA DGX B200.
  • Benchmark ARC-AGI-3. Sur l’ensemble de tâches publiques, AVO a obtenu un score de 100.00 RHAE. Il a réussi l’ensemble des 183 niveaux dans 25 environnements tout en utilisant 12% d’actions en moins que VISTA. À titre de comparaison, une référence autonome Claude Opus 5 n’a obtenu que 30%.

Les chiffres auxquels vous ne devriez pas encore vous fier

Tous ces chiffres proviennent directement de l’article technique de NVIDIA. Aucun chercheur externe ne les a encore vérifiés. NVIDIA a également mis à jour son article pour préciser que le score de 100% s’applique uniquement à l’ensemble public d’ARC-AGI-3, et non aux tâches de compétition semi-privées ou privées. Ces tests ne prouvent pas qu’AVO est moins cher, plus sûr ou prêt pour votre base de code en production. Des outils de supervision supplémentaires augmentent également les coûts de calcul et les points de défaillance potentiels.

Pourquoi cela fait évoluer votre choix d’IA

Jusqu’à présent, les équipes choisissaient principalement leurs outils d’IA en consultant des classements statiques de modèles. AVO soutient que la véritable performance réside dans l’environnement d’exécution autour du modèle. Une bonne structure fait une énorme différence. La vraie question est de savoir si un agent peut utiliser des outils, se remettre des bugs et parvenir à un résultat solide sans gaspiller de ressources de calcul.

Que tester aujourd’hui

Ne vous précipitez pas en production. Si vous souhaitez évaluer un système d’agents, commencez par une tâche de code sans risque ou l’ensemble public ARC-AGI-3. Figez votre modèle, vos outils, le format de mémoire, le budget d’actions et le matériel. Ensuite, exécutez un modèle de base aux côtés de la boucle complète de l’agent. Mesurez le temps d’exécution, l’utilisation des tokens, les nouvelles tentatives et les coûts totaux avant d’engager votre pipeline d’ingénierie.

← Toute l'actualité