
Il 18 agosto 2026, Together AI ha pubblicato un benchmark che confronta due modelli di coding: GPT-5.6 Sol e DeepSeek V4 Pro 0813. Se sviluppi agenti di coding basati su IA, questo test offre una lezione pratica sul bilanciamento tra velocità e costi.
I numeri dietro al test
Together AI ha eseguito 904 rollout su 113 task DeepSWE, concedendo a ciascun modello quattro tentativi (452 rollout per modello). I dati mostrano trade-off evidenti:
- Accuratezza al primo tentativo: GPT-5.6 Sol ha guidato il pass@1 con il 72.7%, mentre DeepSeek V4 Pro 0813 ha ottenuto il 62.8%.
- Accuratezza su quattro tentativi: DeepSeek ha preso la testa sul pass@4 con l’88.5%, superando l’85.8% di Sol.
- Costo del rollout: DeepSeek è costato appena $0.24 per rollout, rispetto a $8.37 per Sol.
- Velocità e passaggi: Sol ha terminato con un tempo mediano di 17 minuti e 53 passaggi. DeepSeek ha impiegato 35 minuti e 146 passaggi.
- Utilizzo di token: Sol ha utilizzato 59k token di output, mentre DeepSeek ne ha consumati 101k.
Sol è veloce. DeepSeek è economico.
Perché il routing supera la scelta di un solo modello
Poiché i modelli hanno punti di forza diversi, Together AI ha testato una sequenza di routing “Pro-first”. Il sistema esegue prima DeepSeek e passa a GPT-5.6 Sol solo se i test falliscono.
Questa configurazione instradata ha risolto l’83.0% dei task a un costo medio di $3.35. Questo supera il punteggio di Sol da solo del 72.7%, riducendo il costo di $8.37 di oltre la metà. Il routing intelligente fa risparmiare.
Cosa tenere a mente
Questi numeri provengono dall’ambiente di test interno di Together AI — nessuno all’esterno dell’azienda li ha ancora verificati in modo indipendente. Together AI afferma inoltre che DeepSeek V4 Pro include hosting negli Stati Uniti, una finestra di contesto da 1.05M, function calling, JSON mode e un’API compatibile con OpenAI. Verifica queste specifiche sul tuo account prima di modificare la pipeline.
Come testare questo approccio nel tuo team
Non affidarti solo ai benchmark dei vendor. Testa entrambi i modelli sul tuo codebase privato:
- Blocca gli ID dei modelli e mantieni costanti le condizioni di test.
- Esegui valutazioni a tentativo singolo e best-of-four sui tuoi task.
- Testa una cascata Pro-first rispetto all’esecuzione di Sol da solo.
- Monitora le percentuali di superamento, il tempo trascorso, il conteggio dei token e i costi.
Fai sempre revisionare le patch di codice da persone. Un test superato non garantisce buon codice.
