List of Best

Together AI a testé deux modèles de code — et a trouvé un moyen de réduire les coûts de plus de moitié

Sommaire
Official announcement image: Together AI Tested Two Coding Models — and Found a Way to Cut Costs by Over Half
Source asset: \2.

Le 18 août 2026, Together AI a publié un benchmark comparant deux modèles de code : GPT-5.6 Sol et DeepSeek V4 Pro 0813. Si vous concevez des agents IA de programmation, ce test offre une leçon pratique pour arbitrer entre vitesse et coût.

Les chiffres derrière le test

Together AI a effectué 904 exécutions sur 113 tâches DeepSWE, accordant à chaque modèle quatre essais (452 exécutions par modèle). Les données montrent des compromis évidents :

  • Précision au premier essai : GPT-5.6 Sol a dominé le pass@1 avec 72.7%, tandis que DeepSeek V4 Pro 0813 a obtenu 62.8%.
  • Précision en quatre essais : DeepSeek a pris la tête sur le pass@4 avec 88.5%, battant les 85.8% de Sol.
  • Coût par exécution : DeepSeek n’a coûté que $0.24 par exécution, contre $8.37 pour Sol.
  • Vitesse et étapes : Sol a terminé en un temps médian de 17 minutes et 53 étapes. DeepSeek a pris 35 minutes et 146 étapes.
  • Consommation de tokens : Sol a utilisé 59k tokens de sortie, tandis que DeepSeek en a consommé 101k.

Sol est rapide. DeepSeek est économique.

Pourquoi le routage l’emporte sur le choix d’un seul modèle

Comme les modèles ont des points forts différents, Together AI a testé une cascade de routage « Pro-first ». Le système exécute d’abord DeepSeek et ne bascule vers GPT-5.6 Sol que si les tests échouent.

Cette configuration avec routage a résolu 83.0% des tâches pour un coût moyen de $3.35. Cela surpasse le score en solo de Sol de 72.7% tout en réduisant le coût de $8.37 de plus de moitié. Le routage intelligent permet de faire des économies.

Ce qu’il faut garder à l’esprit

Ces chiffres proviennent de l’environnement de test propre à Together AI — personne en dehors de l’entreprise ne les a encore vérifiés de manière indépendante. Together AI indique également que DeepSeek V4 Pro inclut un hébergement aux États-Unis, une fenêtre de contexte de 1.05M, le function calling, le mode JSON et une API compatible OpenAI. Vérifiez ces caractéristiques sur votre propre compte avant de modifier votre pipeline.

Comment tester cela pour votre équipe

Ne vous fiez pas uniquement aux benchmarks des fournisseurs. Testez les deux modèles sur votre base de code privée :

  • Figez les identifiants de vos modèles et conservez des conditions de test constantes.
  • Lancez des évaluations en un seul essai et au meilleur des quatre sur vos tâches.
  • Testez une cascade Pro-first par rapport à l’utilisation de Sol seul.
  • Suivez les taux de réussite, le temps d’exécution, le nombre de tokens et les coûts.

Faites toujours relire les correctifs de code par des humains. Un test réussi ne garantit pas un code de qualité.

← Toute l'actualité