
A NVIDIA revelou o AVO, um sistema de agentes criado para lidar com tarefas de programação longas e complexas. Se você desenvolve com IA, isso mostra que ferramentas e ciclos de feedback importam tanto quanto a força bruta dos modelos.
Como o sistema funciona
AVO significa Agentic Variation Operators. Em vez de dar uma única resposta e desistir, o sistema trabalha em um ciclo contínuo. Ele inspeciona tarefas, testa código, verifica o feedback do ambiente e usa memória persistente para corrigir erros. O sistema não para.
A NVIDIA compartilhou dois grandes resultados de testes no NVIDIA Technical Blog:
- Otimização de kernel de GPU. O AVO explorou mais de 500 direções e consolidou 40 versões de kernel. Ele rodou até 10.5% mais rápido que o FlashAttention-4 em sistemas NVIDIA DGX B200.
- Benchmark ARC-AGI-3. No conjunto público de tarefas, o AVO obteve uma pontuação RHAE de 100.00. Ele superou todos os 183 níveis em 25 ambientes, usando 12% menos ações do que o VISTA. Em comparação, uma linha de base do Claude Opus 5 isolado atingiu apenas 30%.
Os números em que você ainda não deve confiar
Todos esses números vêm diretamente da publicação técnica da própria NVIDIA. Nenhum pesquisador externo os verificou ainda. A NVIDIA também atualizou sua publicação para destacar que a pontuação de 100% se aplica apenas ao conjunto público do ARC-AGI-3, e não às tarefas de competição semiprivadas ou privadas. Esses testes não provam que o AVO é mais barato, mais seguro ou está pronto para a sua base de código em produção. Ferramentas extras de supervisão também aumentam os custos de computação e os potenciais pontos de falha.
Por que isso muda sua escolha de IA
Até agora, as equipes escolhiam ferramentas de IA principalmente olhando para tabelas de classificação estáticas de modelos. O AVO defende que o desempenho real reside na estrutura em torno do modelo. Um bom scaffolding faz uma enorme diferença. A verdadeira questão é se um agente consegue usar ferramentas, se recuperar de bugs e alcançar um resultado sólido sem desperdiçar computação.
O que testar hoje
Não tenha pressa para colocar em produção. Se você quiser avaliar um sistema de agentes, comece com uma tarefa de programação descartável ou com o conjunto público do ARC-AGI-3. Defina seu modelo, ferramentas, formato de memória, limite de ações e hardware. Em seguida, execute um modelo base ao lado do ciclo completo de agentes. Meça o tempo de execução, o uso de tokens, as novas tentativas e os custos totais antes de comprometer seu pipeline de engenharia.
