
El 18 de agosto de 2026, Together AI publicó un benchmark comparando dos modelos de programación: GPT-5.6 Sol y DeepSeek V4 Pro 0813. Si desarrollas agentes de IA para programación, esta prueba ofrece una lección práctica sobre cómo equilibrar velocidad y coste.
Las cifras detrás de la prueba
Together AI ejecutó 904 rollouts en 113 tareas de DeepSWE, dando a cada modelo cuatro intentos (452 rollouts por modelo). Los datos muestran claras ventajas y desventajas:
- Precisión al primer intento: GPT-5.6 Sol lideró pass@1 con un 72.7%, mientras que DeepSeek V4 Pro 0813 obtuvo un 62.8%.
- Precisión a cuatro intentos: DeepSeek tomó la delantera en pass@4 con un 88.5%, superando el 85.8% de Sol.
- Coste por rollout: DeepSeek costó solo $0.24 por rollout, en comparación con los $8.37 de Sol.
- Velocidad y pasos: Sol terminó en un tiempo mediano de 17 minutos y 53 pasos. DeepSeek tardó 35 minutos y 146 pasos.
- Uso de tokens: Sol utilizó 59k tokens de salida, mientras que DeepSeek consumió 101k.
Sol es rápido. DeepSeek es barato.
Por qué el enrutamiento supera a elegir un solo modelo
Dado que los modelos tienen diferentes puntos fuertes, Together AI probó una cascada de enrutamiento “Pro-first”. El sistema ejecuta DeepSeek primero y escala a GPT-5.6 Sol solo si las pruebas fallan.
Esta configuración enrutada resolvió el 83.0% de las tareas con un coste medio de $3.35. Eso supera la puntuación en solitario de Sol del 72.7% al tiempo que reduce el coste de $8.37 a más de la mitad. El enrutamiento inteligente ahorra dinero.
Qué debes tener en cuenta
Estas cifras proceden del propio entorno de pruebas de Together AI; nadie fuera de la empresa las ha verificado de forma independiente todavía. Together AI también señala que DeepSeek V4 Pro incluye alojamiento en EE. UU., una ventana de contexto de 1.05M, function calling, modo JSON y una API compatible con OpenAI. Comprueba estas especificaciones en tu propia cuenta antes de realizar cambios en el pipeline.
Cómo probar esto en tu equipo
No confíes únicamente en los benchmarks de los proveedores. Prueba ambos modelos con tu base de código privada:
- Fija los ID de tus modelos y mantén constantes las condiciones de prueba.
- Ejecuta evaluaciones de un solo intento y del mejor de cuatro en tus tareas.
- Prueba una cascada Pro-first frente a ejecutar Sol en solitario.
- Registra las tasas de éxito, el tiempo transcurrido, el recuento de tokens y los costes.
Haz siempre que humanos revisen los parches de código. Una prueba en verde no garantiza un buen código.
