
Vào ngày 18 tháng 8 năm 2026, Together AI đã công bố một bài kiểm chuẩn so sánh hai mô hình lập trình: GPT-5.6 Sol và DeepSeek V4 Pro 0813. Nếu bạn đang xây dựng các AI coding agent, thử nghiệm này mang lại một bài học thực tế về việc đánh đổi tốc độ lấy chi phí.
Những con số đằng sau thử nghiệm
Together AI đã chạy 904 rollout trên 113 tác vụ DeepSWE, cho mỗi mô hình bốn lần thử (452 rollout cho mỗi mô hình). Dữ liệu cho thấy sự đánh đổi rõ ràng:
- Độ chính xác ở lần thử đầu tiên: GPT-5.6 Sol dẫn đầu về pass@1 với 72.7%, trong khi DeepSeek V4 Pro 0813 đạt 62.8%.
- Độ chính xác sau bốn lần thử: DeepSeek vươn lên dẫn đầu ở pass@4 với 88.5%, vượt qua mức 85.8% của Sol.
- Chi phí mỗi rollout: DeepSeek chỉ tốn $0.24 cho mỗi rollout, so với $8.37 của Sol.
- Tốc độ và số bước: Sol hoàn thành với thời gian trung vị là 17 phút và 53 bước. DeepSeek mất 35 phút và 146 bước.
- Lượng token sử dụng: Sol sử dụng 59k output token, trong khi DeepSeek tiêu thụ 101k.
Sol nhanh. DeepSeek rẻ.
Tại sao định tuyến lại vượt trội hơn việc chỉ chọn một mô hình
Vì các mô hình có thế mạnh khác nhau, Together AI đã thử nghiệm cơ chế định tuyến phân tầng “Pro-first”. Hệ thống sẽ chạy DeepSeek trước và chỉ chuyển tiếp sang GPT-5.6 Sol nếu các bài kiểm tra thất bại.
Thiết lập định tuyến này đã giải quyết được 83.0% nhiệm vụ với chi phí trung bình là $3.35. Kết quả này vượt qua điểm số 72.7% khi chạy riêng Sol, đồng thời cắt giảm hơn một nửa mức chi phí $8.37. Định tuyến thông minh giúp tiết kiệm ngân sách.
Những điều bạn cần lưu ý
Những con số này đến từ môi trường thử nghiệm riêng của Together AI — chưa có ai bên ngoài công ty xác minh độc lập chúng. Together AI cũng cho biết DeepSeek V4 Pro hỗ trợ lưu trữ tại Mỹ (US hosting), cửa sổ ngữ cảnh 1.05M, function calling, JSON mode và API tương thích với OpenAI. Hãy kiểm tra các thông số kỹ thuật này trên tài khoản của bạn trước khi thực hiện thay đổi pipeline.
Cách thử nghiệm điều này cho đội ngũ của bạn
Đừng chỉ dựa vào các bài kiểm chuẩn của nhà cung cấp. Hãy thử nghiệm cả hai mô hình trên chính codebase riêng của bạn:
- Ghim model ID của bạn và giữ cố định các điều kiện thử nghiệm.
- Chạy các đánh giá một lần thử và tốt nhất trong bốn lần thử (best-of-four) trên các tác vụ của bạn.
- Thử nghiệm phân tầng Pro-first so với việc chỉ chạy Sol đơn lẻ.
- Theo dõi tỷ lệ vượt qua (pass rate), thời gian chạy thực tế (wall time), số lượng token và chi phí.
Luôn để con người xem xét các bản vá mã (code patch). Một bài kiểm tra vượt qua (màu xanh) không đảm bảo rằng mã nguồn đó là tốt.
