
Am 18. August 2026 hat Together AI einen Benchmark veröffentlicht, der zwei Coding-Modelle vergleicht: GPT-5.6 Sol und DeepSeek V4 Pro 0813. Wenn Sie KI-Coding-Agents entwickeln, bietet dieser Test eine praktische Lektion darin, Geschwindigkeit gegen Kosten abzuwägen.
Die Zahlen hinter dem Test
Together AI führte 904 Durchläufe über 113 DeepSWE-Aufgaben durch und gab jedem Modell vier Versuche (452 Durchläufe pro Modell). Die Daten zeigen klare Vor- und Nachteile:
- Genauigkeit beim ersten Versuch: GPT-5.6 Sol führte bei pass@1 mit 72.7%, während DeepSeek V4 Pro 0813 62.8% erreichte.
- Genauigkeit nach vier Versuchen: DeepSeek übernahm bei pass@4 mit 88.5% die Führung und übertraf die 85.8% von Sol.
- Kosten pro Durchlauf: DeepSeek kostete nur $0.24 pro Durchlauf, verglichen mit $8.37 bei Sol.
- Geschwindigkeit und Schritte: Sol benötigte im Median 17 Minuten und 53 Schritte. DeepSeek brauchte 35 Minuten und 146 Schritte.
- Token-Verbrauch: Sol verbrauchte 59k Output-Tokens, während DeepSeek 101k verbrauchte.
Sol ist schnell. DeepSeek ist günstig.
Warum Routing besser ist als die Wahl nur eines Modells
Da die Modelle unterschiedliche Stärken haben, testete Together AI eine „Pro-first“-Routing-Kaskade. Das System führt zuerst DeepSeek aus und wechselt nur dann zu GPT-5.6 Sol, wenn Tests fehlschlagen.
Dieses geroutete Setup löste 83.0% der Aufgaben bei durchschnittlichen Kosten von $3.35. Das schlägt den Solo-Wert von Sol von 72.7% und senkt die Kosten von $8.37 um mehr als die Hälfte. Intelligentes Routing spart Geld.
Was Sie beachten sollten
Diese Zahlen stammen aus Together AIs eigener Testumgebung — bisher hat niemand außerhalb des Unternehmens sie unabhängig überprüft. Together AI gibt außerdem an, dass DeepSeek V4 Pro US-Hosting, ein 1.05M Kontextfenster, Function Calling, JSON-Modus und eine OpenAI-kompatible API umfasst. Überprüfen Sie diese Spezifikationen in Ihrem eigenen Account, bevor Sie Änderungen an Ihrer Pipeline vornehmen.
So testen Sie dies für Ihr Team
Verlassen Sie sich nicht allein auf Benchmarks der Anbieter. Testen Sie beide Modelle mit Ihrer privaten Codebasis:
- Pinnen Sie Ihre Modell-IDs und halten Sie die Testbedingungen konstant.
- Führen Sie Einzelversuchs- und Best-of-Four-Evaluierungen für Ihre Aufgaben durch.
- Testen Sie eine Pro-first-Kaskade im Vergleich zur alleinigen Nutzung von Sol.
- Verfolgen Sie Erfolgsquoten, Ausführungszeiten, Token-Zahlen und Kosten.
Lassen Sie Code-Patches immer von Menschen überprüfen. Ein grüner Test garantiert keinen guten Code.
