
Le 18 août 2026, Together AI a publié un benchmark comparant deux modèles de code : GPT-5.6 Sol et DeepSeek V4 Pro 0813. Si vous concevez des agents IA de programmation, ce test offre une leçon pratique pour arbitrer entre vitesse et coût.
Les chiffres derrière le test
Together AI a effectué 904 exécutions sur 113 tâches DeepSWE, accordant à chaque modèle quatre essais (452 exécutions par modèle). Les données montrent des compromis évidents :
- Précision au premier essai : GPT-5.6 Sol a dominé le pass@1 avec 72.7%, tandis que DeepSeek V4 Pro 0813 a obtenu 62.8%.
- Précision en quatre essais : DeepSeek a pris la tête sur le pass@4 avec 88.5%, battant les 85.8% de Sol.
- Coût par exécution : DeepSeek n’a coûté que $0.24 par exécution, contre $8.37 pour Sol.
- Vitesse et étapes : Sol a terminé en un temps médian de 17 minutes et 53 étapes. DeepSeek a pris 35 minutes et 146 étapes.
- Consommation de tokens : Sol a utilisé 59k tokens de sortie, tandis que DeepSeek en a consommé 101k.
Sol est rapide. DeepSeek est économique.
Pourquoi le routage l’emporte sur le choix d’un seul modèle
Comme les modèles ont des points forts différents, Together AI a testé une cascade de routage « Pro-first ». Le système exécute d’abord DeepSeek et ne bascule vers GPT-5.6 Sol que si les tests échouent.
Cette configuration avec routage a résolu 83.0% des tâches pour un coût moyen de $3.35. Cela surpasse le score en solo de Sol de 72.7% tout en réduisant le coût de $8.37 de plus de moitié. Le routage intelligent permet de faire des économies.
Ce qu’il faut garder à l’esprit
Ces chiffres proviennent de l’environnement de test propre à Together AI — personne en dehors de l’entreprise ne les a encore vérifiés de manière indépendante. Together AI indique également que DeepSeek V4 Pro inclut un hébergement aux États-Unis, une fenêtre de contexte de 1.05M, le function calling, le mode JSON et une API compatible OpenAI. Vérifiez ces caractéristiques sur votre propre compte avant de modifier votre pipeline.
Comment tester cela pour votre équipe
Ne vous fiez pas uniquement aux benchmarks des fournisseurs. Testez les deux modèles sur votre base de code privée :
- Figez les identifiants de vos modèles et conservez des conditions de test constantes.
- Lancez des évaluations en un seul essai et au meilleur des quatre sur vos tâches.
- Testez une cascade Pro-first par rapport à l’utilisation de Sol seul.
- Suivez les taux de réussite, le temps d’exécution, le nombre de tokens et les coûts.
Faites toujours relire les correctifs de code par des humains. Un test réussi ne garantit pas un code de qualité.
