List of Best

El nuevo sistema AVO de NVIDIA demuestra que las herramientas para agentes importan más que la potencia bruta de los modelos

Índice
Editorial illustration for: NVIDIA's New AVO System Shows Agent Tools Matter More Than Just Raw Models
Illustration by AI

NVIDIA ha presentado AVO, un sistema de agentes diseñado para gestionar tareas de programación largas y complejas. Si desarrollas con IA, esto demuestra que las herramientas y los bucles de retroalimentación importan tanto como la potencia bruta del modelo.

Cómo funciona el sistema

AVO son las siglas de Agentic Variation Operators. En lugar de dar una sola respuesta y detenerse, el sistema funciona mediante un bucle continuo. Inspecciona las tareas, prueba el código, comprueba la retroalimentación del entorno y utiliza memoria persistente para corregir errores. El sistema no se detiene.

NVIDIA ha compartido dos grandes resultados de pruebas en el NVIDIA Technical Blog:

  • Optimización de kernels de GPU. AVO exploró más de 500 direcciones y confirmó 40 versiones de kernel. Funcionó hasta un 10.5% más rápido que FlashAttention-4 en sistemas NVIDIA DGX B200.
  • Benchmark ARC-AGI-3. En el conjunto de tareas públicas, AVO obtuvo una puntuación de 100.00 RHAE. Superó los 183 niveles en 25 entornos utilizando un 12% menos de acciones que VISTA. En comparación, una referencia independiente de Claude Opus 5 obtuvo solo un 30%.

Los números de los que aún no deberías fiarte

Todas estas cifras proceden directamente de la propia publicación técnica de NVIDIA. Ningún investigador externo las ha verificado todavía. NVIDIA también actualizó su publicación para señalar que la puntuación del 100% se aplica únicamente al conjunto público de ARC-AGI-3, no a las tareas de competición semiprivadas o privadas. Estas pruebas no demuestran que AVO sea más barato, más seguro o que esté listo para tu código en producción. Las herramientas de supervisión adicionales también aumentan los costes de computación y los posibles puntos de fallo.

Por qué esto cambia tu elección de IA

Hasta ahora, la mayoría de los equipos elegían herramientas de IA fijándose en las tablas de clasificación estáticas de modelos. AVO sostiene que el rendimiento real reside en la estructura que rodea al modelo. Un buen andamiaje marca una gran diferencia. La verdadera pregunta es si un agente puede utilizar herramientas, recuperarse de errores y alcanzar un resultado sólido sin desperdiciar computación.

Qué probar hoy

No te apresures a llevarlo a producción. Si quieres evaluar un sistema de agentes, empieza con una tarea de programación desechable o con el conjunto público de ARC-AGI-3. Fija tu modelo, herramientas, formato de memoria, presupuesto de acciones y hardware. Luego ejecuta un modelo base junto al bucle completo del agente. Mide el tiempo de ejecución, el uso de tokens, los reintentos y los costes totales antes de comprometer tu flujo de ingeniería.

← Todas las noticias