
A Liquid AI lançou novos checkpoints de rascunho chamados DSpark para fazer seus modelos LFM2.5 rodarem mais rápido em servidores e dispositivos locais. Se você roda modelos de IA localmente ou desenvolve com ferramentas de código aberto, esta atualização pode reduzir o tempo de espera sem alterar o texto final gerado.
De acordo com uma publicação da Liquid AI / Hugging Face divulgada em 2026-08-20, o DSpark adiciona decodificação especulativa a três modelos: LFM2.5-1.2B-Instruct, LFM2.5-2.6B e LFM2.5-8B-A1B. Nessa configuração, um pequeno modelo de rascunho prevê as próximas palavras rapidamente. Em seguida, o modelo principal as verifica em uma única passagem. Na decodificação greedy padrão, qualquer token incorreto do rascunho é substituído pelo modelo principal. Isso significa que o resultado final permanece idêntico.
Os números que a Liquid AI relata
A Liquid AI compartilhou números expressivos de benchmark em diversas configurações:
- Taxa de transferência até 3.18x maior na GPU em uma única Nvidia H100 80GB rodando em precisão BF16.
- Velocidade no dispositivo até 2.87x mais rápida em um Apple M4 Max MacBook Pro usando pesos FP16 GGUF no Metal.
- Latência média 57% menor para chamadas de função com LFM2.5-2.6B.
- Aceleração média de 18% no dispositivo para o modelo MoE LFM2.5-8B-A1B, no qual o Metal atualmente ativa especialistas adicionais durante a verificação.
A integração já está pronta hoje. Você já pode usá-la por meio do llama.cpp PR #27383 e do SGLang PR #31041.
A parte em que você não deve confiar cegamente
Todos esses números de desempenho vêm diretamente dos benchmarks internos da Liquid AI. Nenhum terceiro independente os testou ainda. A Liquid AI realizou testes com tamanho de bloco 9, tamanho de lote 1, temperatura 0, até 256 tokens de saída e cinco conjuntos de dados de benchmark. Os resultados não garantem ganhos em chips diferentes, em lotes grandes ou com configurações de temperatura mais criativas. A Liquid AI também observou que os ganhos de velocidade no modelo 1.2B variaram em até 52%, dependendo do texto.
A velocidade nunca é garantida.
O que isso significa para o seu setup
A decodificação especulativa não é mágica. Ela só ajuda se o modelo pequeno acertar na maioria das vezes. Se o rascunho falhar, verificar os palpites desperdiça tempo.
Ainda assim, o suporte desde o primeiro dia no llama.cpp e no SGLang facilita os testes. A velocidade local importa.
Como testar você mesmo
Não confie em médias. Faça seus próprios testes antes de alterar seu pipeline de produção.
Pegue exatamente os pesos de rascunho e de destino do DSpark para o seu modelo LFM2.5. Carregue-os na sua versão atual do llama.cpp ou do SGLang. Execute seus prompts habituais e chamadas de função com e sem o DSpark. Meça os tokens por segundo, a memória, a taxa de aceitação do rascunho e o sucesso das chamadas de ferramentas. Se o ganho de velocidade se mantiver no seu hardware e suas ferramentas retornarem argumentos válidos, o DSpark é uma vitória certa.
