
Liquid AI hat neue Draft-Checkpoints namens DSpark veröffentlicht, damit LFM2.5-Modelle auf Servern und lokalen Geräten schneller laufen. Wenn Sie KI-Modelle lokal ausführen oder mit Open-Source-Tools entwickeln, kann dieses Update die Wartezeiten verkürzen, ohne die finale Textausgabe zu verändern.
Laut einem am 2026-08-20 veröffentlichten Beitrag von Liquid AI / Hugging Face bringt DSpark Speculative Decoding für drei Modelle: LFM2.5-1.2B-Instruct, LFM2.5-2.6B und LFM2.5-8B-A1B. Bei diesem Ansatz sagt ein kleines Draft-Modell anstehende Wörter schnell voraus. Anschließend prüft das Hauptmodell diese in einem einzigen Durchlauf. Unter standardmäßigem Greedy Decoding wird jeder fehlerhafte Draft-Token durch das Hauptmodell ersetzt. Das bedeutet, dass die finale Ausgabe identisch bleibt.
Die Zahlen, die Liquid AI meldet
Liquid AI teilte starke Benchmark-Zahlen für verschiedene Setups mit:
- Bis zu 3.18x höherer GPU-Durchsatz auf einer einzelnen Nvidia H100 80GB in BF16-Präzision.
- Bis zu 2.87x höhere On-Device-Geschwindigkeit auf einem Apple M4 Max MacBook Pro mit FP16 GGUF-Gewichten in Metal.
- Durchschnittlich 57% geringere Latenz für Function Calling mit LFM2.5-2.6B.
- Durchschnittlich 18% Beschleunigung auf dem Gerät für das MoE-Modell LFM2.5-8B-A1B, bei dem Metal während der Verifizierung derzeit zusätzliche Experten aktiviert.
Die Integration steht ab heute bereit. Sie können sie bereits über llama.cpp PR #27383 und SGLang PR #31041 nutzen.
Der Teil, dem Sie nicht blind vertrauen sollten
All diese Leistungswerte stammen direkt aus den internen Benchmarks von Liquid AI. Bislang hat keine unabhängige Stelle sie überprüft. Liquid AI führte die Tests mit Blockgröße 9, Batchgröße 1, Temperatur 0, bis zu 256 Ausgabe-Tokens und fünf Benchmark-Datensätzen durch. Die Ergebnisse garantieren keine Einsparungen auf anderen Chips, bei großen Batches oder bei kreativen Temperatureinstellungen. Liquid AI merkte zudem an, dass die Geschwindigkeitsgewinne beim 1.2B-Modell je nach Text um bis zu 52% variierten.
Geschwindigkeit ist nie garantiert.
Was das für Ihr Setup bedeutet
Speculative Decoding ist keine Magie. Es hilft nur, wenn das kleine Modell meistens richtig liegt. Schlägt der Entwurf fehl, verschwendet das Überprüfen der Vermutungen Zeit.
Dennoch macht die sofortige Unterstützung in llama.cpp und SGLang das Testen einfach. Lokale Geschwindigkeit zählt.
Wie Sie es selbst testen können
Vertrauen Sie keinen Durchschnittswerten. Führen Sie eigene Tests durch, bevor Sie Ihre Produktions-Pipeline umstellen.
Nehmen Sie die genauen DSpark-Draft- und Ziel-Gewichte für Ihr LFM2.5-Modell. Laden Sie sie in Ihren aktuellen llama.cpp- oder SGLang-Build. Führen Sie Ihre üblichen Prompts und Funktionsaufrufe mit und ohne DSpark aus. Messen Sie Tokens pro Sekunde, Speicherverbrauch, Draft-Akzeptanzrate und den Erfolg von Tool-Calls. Wenn der Geschwindigkeitsvorteil auf Ihrer Hardware anhält und Ihre Tools gültige Argumente liefern, ist DSpark ein klarer Gewinn.
