List of Best

Hệ thống AVO mới của NVIDIA cho thấy công cụ của agent quan trọng hơn chỉ là mô hình thuần túy

Mục lục
Editorial illustration for: NVIDIA's New AVO System Shows Agent Tools Matter More Than Just Raw Models
Illustration by AI

NVIDIA đã công bố AVO, một hệ thống agent được xây dựng để xử lý các công việc lập trình dài và phức tạp. Nếu bạn đang phát triển ứng dụng với AI, điều này cho thấy các công cụ và vòng lặp phản hồi quan trọng không kém gì sức mạnh của mô hình thuần túy.

Cách hệ thống hoạt động

AVO là viết tắt của Agentic Variation Operators. Thay vì chỉ đưa ra một câu trả lời rồi dừng lại, hệ thống hoạt động thông qua một vòng lặp liên tục. Nó kiểm tra tác vụ, thử nghiệm code, kiểm tra phản hồi từ môi trường và sử dụng bộ nhớ liên tục để sửa lỗi. Hệ thống không dừng lại.

NVIDIA đã chia sẻ hai kết quả thử nghiệm lớn trên NVIDIA Technical Blog:

  • Tối ưu hóa GPU kernel. AVO đã khám phá hơn 500 hướng đi và commit 40 phiên bản kernel. Nó chạy nhanh hơn tới 10.5% so với FlashAttention-4 trên các hệ thống NVIDIA DGX B200.
  • Benchmark ARC-AGI-3. Trên bộ tác vụ công khai, AVO đạt điểm đánh giá 100.00 RHAE. Hệ thống đã vượt qua toàn bộ 183 màn chơi trên 25 môi trường trong khi sử dụng ít hơn 12% số hành động so với VISTA. Để so sánh, mô hình cơ sở Claude Opus 5 độc lập chỉ đạt 30%.

Những con số bạn chưa nên vội tin

Tất cả các số liệu này đều đến trực tiếp từ bài viết kỹ thuật của chính NVIDIA. Chưa có nhà nghiên cứu bên ngoài nào xác minh chúng. NVIDIA cũng đã cập nhật bài viết để lưu ý rằng điểm số 100% chỉ áp dụng cho bộ ARC-AGI-3 công khai, không phải các tác vụ thi đấu bán riêng tư hoặc riêng tư. Các bài kiểm tra này không chứng minh rằng AVO rẻ hơn, an toàn hơn hay đã sẵn sàng cho codebase thực tế của bạn. Các công cụ giám sát bổ sung cũng làm tăng chi phí tính toán và các điểm lỗi tiềm ẩn.

Tại sao điều này thay đổi lựa chọn AI của bạn

Từ trước đến nay, các đội ngũ chủ yếu chọn công cụ AI bằng cách nhìn vào bảng xếp hạng mô hình tĩnh. AVO cho thấy hiệu năng thực sự nằm ở bộ khung hỗ trợ xung quanh mô hình. Cấu trúc khung giàn tốt tạo ra sự khác biệt rất lớn. Câu hỏi thực sự là liệu một agent có thể sử dụng công cụ, phục hồi sau lỗi và đạt được kết quả vững chắc mà không lãng phí tài nguyên tính toán hay không.

Những gì cần thử nghiệm hôm nay

Đừng vội đưa vào môi trường production. Nếu bạn muốn đánh giá một hệ thống agent, hãy bắt đầu với một tác vụ viết code dùng một lần hoặc bộ ARC-AGI-3 công khai. Hãy cố định mô hình, công cụ, định dạng bộ nhớ, giới hạn hành động và phần cứng của bạn. Sau đó chạy một mô hình cơ bản song song với toàn bộ vòng lặp agent. Đo lường thời gian chạy, lượng token sử dụng, số lần thử lại và tổng chi phí trước khi bạn áp dụng vào quy trình kỹ thuật của mình.

← Tất cả tin tức