List of Best

Novo sistema AVO da NVIDIA mostra que ferramentas de agentes importam mais do que apenas modelos brutos

Sumário
Editorial illustration for: NVIDIA's New AVO System Shows Agent Tools Matter More Than Just Raw Models
Illustration by AI

A NVIDIA revelou o AVO, um sistema de agentes criado para lidar com tarefas de programação longas e complexas. Se você desenvolve com IA, isso mostra que ferramentas e ciclos de feedback importam tanto quanto a força bruta dos modelos.

Como o sistema funciona

AVO significa Agentic Variation Operators. Em vez de dar uma única resposta e desistir, o sistema trabalha em um ciclo contínuo. Ele inspeciona tarefas, testa código, verifica o feedback do ambiente e usa memória persistente para corrigir erros. O sistema não para.

A NVIDIA compartilhou dois grandes resultados de testes no NVIDIA Technical Blog:

  • Otimização de kernel de GPU. O AVO explorou mais de 500 direções e consolidou 40 versões de kernel. Ele rodou até 10.5% mais rápido que o FlashAttention-4 em sistemas NVIDIA DGX B200.
  • Benchmark ARC-AGI-3. No conjunto público de tarefas, o AVO obteve uma pontuação RHAE de 100.00. Ele superou todos os 183 níveis em 25 ambientes, usando 12% menos ações do que o VISTA. Em comparação, uma linha de base do Claude Opus 5 isolado atingiu apenas 30%.

Os números em que você ainda não deve confiar

Todos esses números vêm diretamente da publicação técnica da própria NVIDIA. Nenhum pesquisador externo os verificou ainda. A NVIDIA também atualizou sua publicação para destacar que a pontuação de 100% se aplica apenas ao conjunto público do ARC-AGI-3, e não às tarefas de competição semiprivadas ou privadas. Esses testes não provam que o AVO é mais barato, mais seguro ou está pronto para a sua base de código em produção. Ferramentas extras de supervisão também aumentam os custos de computação e os potenciais pontos de falha.

Por que isso muda sua escolha de IA

Até agora, as equipes escolhiam ferramentas de IA principalmente olhando para tabelas de classificação estáticas de modelos. O AVO defende que o desempenho real reside na estrutura em torno do modelo. Um bom scaffolding faz uma enorme diferença. A verdadeira questão é se um agente consegue usar ferramentas, se recuperar de bugs e alcançar um resultado sólido sem desperdiçar computação.

O que testar hoje

Não tenha pressa para colocar em produção. Se você quiser avaliar um sistema de agentes, comece com uma tarefa de programação descartável ou com o conjunto público do ARC-AGI-3. Defina seu modelo, ferramentas, formato de memória, limite de ações e hardware. Em seguida, execute um modelo base ao lado do ciclo completo de agentes. Meça o tempo de execução, o uso de tokens, as novas tentativas e os custos totais antes de comprometer seu pipeline de engenharia.

← Todas as notícias