List of Best

Liquid AI rilascia i checkpoint DSpark per velocizzare i modelli LFM2.5 su GPU e laptop

Indice
Editorial illustration for: Liquid AI Releases DSpark Checkpoints to Speed Up LFM2.5 Models on GPUs and Laptops
Illustration by AI

Liquid AI ha rilasciato nuovi draft checkpoint chiamati DSpark per far funzionare più velocemente i suoi modelli LFM2.5 su server e dispositivi locali. Se esegui modelli di IA in locale o sviluppi con strumenti open source, questo aggiornamento può ridurre i tempi di attesa senza modificare il testo finale generato.

Secondo un post di Liquid AI / Hugging Face pubblicato il 2026-08-20, DSpark aggiunge la speculative decoding a tre modelli: LFM2.5-1.2B-Instruct, LFM2.5-2.6B e LFM2.5-8B-A1B. In questa configurazione, un piccolo modello di bozza predice rapidamente le parole successive. Poi, il modello principale le verifica in un unico passaggio. Con il greedy decoding standard, ogni token di bozza errato viene sostituito dal modello principale. Ciò significa che l’output finale rimane identico.

I numeri riportati da Liquid AI

Liquid AI ha condiviso ottimi risultati nei benchmark su diverse configurazioni:

  • Throughput GPU fino a 3.18x superiore su una singola Nvidia H100 80GB in precisione BF16.
  • Velocità on-device fino a 2.87x maggiore su un MacBook Pro con Apple M4 Max utilizzando pesi GGUF FP16 in Metal.
  • Latenza inferiore in media del 57% per il function calling con LFM2.5-2.6B.
  • Accelerazione media del 18% on-device per il modello MoE LFM2.5-8B-A1B, dove Metal attualmente attiva expert aggiuntivi durante la verifica.

L’integrazione è pronta già da oggi. Puoi già utilizzarla tramite la PR #27383 di llama.cpp e la PR #31041 di SGLang.

La parte a cui non dovresti credere ciecamente

Tutti questi dati sulle prestazioni provengono direttamente dai benchmark interni di Liquid AI. Nessuna terza parte indipendente li ha ancora testati. Liquid AI ha condotto i test con block size 9, batch size 1, temperature 0, fino a 256 token di output e cinque dataset di benchmark. I risultati non garantiscono miglioramenti su chip diversi, con batch di grandi dimensioni o con impostazioni di temperature più creative. Liquid AI ha inoltre fatto notare che i guadagni di velocità sul modello 1.2B sono variati fino al 52% a seconda del testo.

La velocità non è mai garantita.

Cosa significa per la tua configurazione

La speculative decoding non è una magia. È utile solo se il modello piccolo indovina correttamente la maggior parte delle volte. Se la bozza fallisce, verificare le ipotesi fa perdere tempo.

Tuttavia, il supporto immediato in llama.cpp e SGLang rende i test semplici. La velocità in locale conta.

Come testarlo tu stesso

Non fidarti delle medie. Esegui i tuoi test prima di modificare la tua pipeline di produzione.

Prendi i pesi draft e target esatti di DSpark per il tuo modello LFM2.5. Caricali nella tua attuale build di llama.cpp o SGLang. Esegui i tuoi soliti prompt e function call con e senza DSpark. Misura token al secondo, memoria, draft acceptance rate e successo delle tool-call. Se l’accelerazione si conferma sul tuo hardware e i tuoi strumenti restituiscono argomenti validi, DSpark è una vittoria assicurata.

← Tutte le notizie