List of Best

Liquid AI lança checkpoints DSpark para acelerar modelos LFM2.5 em GPUs e laptops

Sumário
Editorial illustration for: Liquid AI Releases DSpark Checkpoints to Speed Up LFM2.5 Models on GPUs and Laptops
Illustration by AI

A Liquid AI lançou novos checkpoints de rascunho chamados DSpark para fazer seus modelos LFM2.5 rodarem mais rápido em servidores e dispositivos locais. Se você roda modelos de IA localmente ou desenvolve com ferramentas de código aberto, esta atualização pode reduzir o tempo de espera sem alterar o texto final gerado.

De acordo com uma publicação da Liquid AI / Hugging Face divulgada em 2026-08-20, o DSpark adiciona decodificação especulativa a três modelos: LFM2.5-1.2B-Instruct, LFM2.5-2.6B e LFM2.5-8B-A1B. Nessa configuração, um pequeno modelo de rascunho prevê as próximas palavras rapidamente. Em seguida, o modelo principal as verifica em uma única passagem. Na decodificação greedy padrão, qualquer token incorreto do rascunho é substituído pelo modelo principal. Isso significa que o resultado final permanece idêntico.

Os números que a Liquid AI relata

A Liquid AI compartilhou números expressivos de benchmark em diversas configurações:

  • Taxa de transferência até 3.18x maior na GPU em uma única Nvidia H100 80GB rodando em precisão BF16.
  • Velocidade no dispositivo até 2.87x mais rápida em um Apple M4 Max MacBook Pro usando pesos FP16 GGUF no Metal.
  • Latência média 57% menor para chamadas de função com LFM2.5-2.6B.
  • Aceleração média de 18% no dispositivo para o modelo MoE LFM2.5-8B-A1B, no qual o Metal atualmente ativa especialistas adicionais durante a verificação.

A integração já está pronta hoje. Você já pode usá-la por meio do llama.cpp PR #27383 e do SGLang PR #31041.

A parte em que você não deve confiar cegamente

Todos esses números de desempenho vêm diretamente dos benchmarks internos da Liquid AI. Nenhum terceiro independente os testou ainda. A Liquid AI realizou testes com tamanho de bloco 9, tamanho de lote 1, temperatura 0, até 256 tokens de saída e cinco conjuntos de dados de benchmark. Os resultados não garantem ganhos em chips diferentes, em lotes grandes ou com configurações de temperatura mais criativas. A Liquid AI também observou que os ganhos de velocidade no modelo 1.2B variaram em até 52%, dependendo do texto.

A velocidade nunca é garantida.

O que isso significa para o seu setup

A decodificação especulativa não é mágica. Ela só ajuda se o modelo pequeno acertar na maioria das vezes. Se o rascunho falhar, verificar os palpites desperdiça tempo.

Ainda assim, o suporte desde o primeiro dia no llama.cpp e no SGLang facilita os testes. A velocidade local importa.

Como testar você mesmo

Não confie em médias. Faça seus próprios testes antes de alterar seu pipeline de produção.

Pegue exatamente os pesos de rascunho e de destino do DSpark para o seu modelo LFM2.5. Carregue-os na sua versão atual do llama.cpp ou do SGLang. Execute seus prompts habituais e chamadas de função com e sem o DSpark. Meça os tokens por segundo, a memória, a taxa de aceitação do rascunho e o sucesso das chamadas de ferramentas. Se o ganho de velocidade se mantiver no seu hardware e suas ferramentas retornarem argumentos válidos, o DSpark é uma vitória certa.

← Todas as notícias