
NVIDIA가 길고 복잡한 프로그래밍 작업을 처리하도록 구축된 에이전트 시스템인 AVO를 공개했습니다. AI를 활용해 개발하고 있다면, 이는 도구와 피드백 루프가 순수한 모델 성능만큼이나 중요하다는 점을 보여줍니다.
시스템 작동 방식
AVO는 Agentic Variation Operators의 약자입니다. 한 번의 답변만 내놓고 끝내는 대신, 이 시스템은 지속적인 루프를 통해 작동합니다. 작업을 점검하고, 코드를 테스트하며, 환경으로부터 피드백을 확인하고, 영구 메모리를 사용해 실수를 바로잡습니다. 시스템은 멈추지 않습니다.
NVIDIA는 NVIDIA Technical Blog를 통해 두 가지 주요 테스트 결과를 공유했습니다:
- GPU 커널 최적화. AVO는 500개 이상의 방향을 탐색하고 40개의 커널 버전을 커밋했습니다. NVIDIA DGX B200 시스템에서 FlashAttention-4보다 최대 10.5% 더 빠르게 실행되었습니다.
- ARC-AGI-3 벤치마크. 공개 태스크 세트에서 AVO는 100.00 RHAE 점수를 기록했습니다. VISTA보다 12% 적은 동작을 사용하면서 25개 환경에 걸친 183개 레벨을 모두 통과했습니다. 이에 비해 단독 Claude Opus 5 베이스라인은 30%에 그쳤습니다.
아직 온전히 신뢰해서는 안 되는 수치들
이 모든 수치는 NVIDIA의 자체 기술 게시물에서 직접 가져온 것입니다. 아직 외부 연구진의 검증을 거치지 않았습니다. NVIDIA 역시 100% 점수가 준비공개 또는 비공개 경쟁 태스크가 아닌 공개 ARC-AGI-3 세트에만 적용된다는 점을 게시물에 업데이트했습니다. 이러한 테스트가 AVO가 더 저렴하거나, 더 안전하거나, 실제 운영 코드베이스에 바로 적용될 준비가 되었음을 증명하는 것은 아닙니다. 추가적인 감독 도구는 연산 비용과 잠재적인 실패 지점도 늘립니다.
이것이 AI 선택 기준을 바꾸는 이유
지금까지 대부분의 팀은 정적 모델 리더보드를 보고 AI 도구를 선택해 왔습니다. AVO는 진정한 성능이 모델을 둘러싼 하네스(harness)에 있다고 주장합니다. 훌륭한 스캐폴딩은 큰 차이를 만들어냅니다. 진짜 핵심은 에이전트가 연산 자원을 낭비하지 않으면서 도구를 활용하고, 버그를 복구하며, 확실한 결과에 도달할 수 있는지 여부입니다.
지금 당장 테스트해 볼 사항
프로덕션 도입을 서두르지 마세요. 에이전트 시스템을 평가하고 싶다면 일회성 코딩 작업이나 공개 ARC-AGI-3 세트부터 시작하세요. 모델, 도구, 메모리 포맷, 액션 예산, 하드웨어를 고정하세요. 그런 다음 기본 모델과 전체 에이전트 루프를 나란히 실행해 보세요. 엔지니어링 파이프라인에 도입하기 전에 실행 시간, 토큰 사용량, 재시도 횟수, 총 비용을 측정하세요.
