
Em 18 de agosto de 2026, a Together AI publicou um benchmark comparando dois modelos de programação: GPT-5.6 Sol e DeepSeek V4 Pro 0813. Se você desenvolve agentes de programação com IA, este teste oferece uma lição prática sobre equilibrar velocidade e custo.
Os números por trás do teste
A Together AI executou 904 rollouts em 113 tarefas do DeepSWE, dando a cada modelo quatro tentativas (452 rollouts por modelo). Os dados mostram compensações claras:
- Precisão na primeira tentativa: O GPT-5.6 Sol liderou o pass@1 com 72.7%, enquanto o DeepSeek V4 Pro 0813 alcançou 62.8%.
- Precisão em quatro tentativas: O DeepSeek assumiu a liderança no pass@4 com 88.5%, superando os 85.8% do Sol.
- Custo por rollout: O DeepSeek custou apenas $0.24 por rollout, em comparação com $8.37 do Sol.
- Velocidade e passos: O Sol terminou em um tempo mediano de 17 minutos e 53 passos. O DeepSeek levou 35 minutos e 146 passos.
- Uso de tokens: O Sol usou 59k tokens de saída, enquanto o DeepSeek consumiu 101k.
O Sol é rápido. O DeepSeek é barato.
Por que o roteamento supera a escolha de um único modelo
Como os modelos têm pontos fortes diferentes, a Together AI testou uma cascata de roteamento “Pro-first”. O sistema executa o DeepSeek primeiro e escala para o GPT-5.6 Sol apenas se os testes falharem.
Essa configuração com roteamento resolveu 83.0% das tarefas a um custo médio de $3.35. Isso supera a pontuação individual de 72.7% do Sol e ainda reduz o custo de $8.37 em mais da metade. O roteamento inteligente economiza dinheiro.
O que você deve ter em mente
Esses números vêm do próprio ambiente de testes da Together AI — ninguém de fora da empresa os verificou de forma independente ainda. A Together AI também afirma que o DeepSeek V4 Pro inclui hospedagem nos EUA, janela de contexto de 1.05M, function calling, modo JSON e uma API compatível com a OpenAI. Verifique essas especificações em sua própria conta antes de fazer alterações no pipeline.
Como testar isso para sua equipe
Não confie apenas em benchmarks de fornecedores. Teste ambos os modelos em sua base de código privada:
- Fixe os IDs dos seus modelos e mantenha as condições de teste constantes.
- Execute avaliações de tentativa única e melhor de quatro em suas tarefas.
- Teste uma cascata Pro-first em comparação com a execução do Sol sozinho.
- Monitore taxas de aprovação, tempo de execução, contagem de tokens e custos.
Sempre peça para humanos revisarem as correções de código. Um teste verde não garante um código bom.
