List of Best

Liquid AI lanza checkpoints de DSpark para acelerar los modelos LFM2.5 en GPU y portátiles

Índice
Editorial illustration for: Liquid AI Releases DSpark Checkpoints to Speed Up LFM2.5 Models on GPUs and Laptops
Illustration by AI

Liquid AI ha lanzado nuevos checkpoints borrador llamados DSpark para hacer que sus modelos LFM2.5 funcionen más rápido en servidores y dispositivos locales. Si ejecutas modelos de IA localmente o desarrollas con herramientas de código abierto, esta actualización puede reducir los tiempos de espera sin alterar el texto final.

Según una publicación de Liquid AI / Hugging Face publicada el 2026-08-20, DSpark añade decodificación especulativa a tres modelos: LFM2.5-1.2B-Instruct, LFM2.5-2.6B y LFM2.5-8B-A1B. En esta configuración, un modelo borrador pequeño predice rápidamente las próximas palabras. Después, el modelo principal las comprueba en una sola pasada. Con la decodificación voraz estándar, cualquier token incorrecto del borrador es sustituido por el modelo principal. Eso significa que el resultado final sigue siendo idéntico.

Las cifras que publica Liquid AI

Liquid AI ha compartido cifras destacadas de rendimiento en varias configuraciones:

  • Hasta 3.18x más rendimiento de GPU en una sola Nvidia H100 80GB ejecutándose en precisión BF16.
  • Hasta 2.87x más velocidad en el dispositivo en un MacBook Pro con Apple M4 Max usando pesos GGUF FP16 en Metal.
  • Un 57% menos de latencia media en llamadas a funciones con LFM2.5-2.6B.
  • Una aceleración media del 18% en el dispositivo para el modelo MoE LFM2.5-8B-A1B, donde Metal activa actualmente expertos adicionales durante la verificación.

La integración ya está disponible hoy. Ya puedes utilizarla a través de llama.cpp PR #27383 y SGLang PR #31041.

La parte de la que no deberías fiarte a ciegas

Todas estas cifras de rendimiento proceden directamente de las pruebas de rendimiento internas de Liquid AI. Ningún tercero independiente las ha probado todavía. Liquid AI realizó pruebas con tamaño de bloque 9, tamaño de lote 1, temperatura 0, hasta 256 tokens de salida y cinco conjuntos de datos de prueba. Los resultados no garantizan mejoras en diferentes chips, en lotes grandes ni con ajustes de temperatura creativos. Liquid AI también señaló que las mejoras de velocidad en el modelo 1.2B variaban hasta un 52% según el texto.

La velocidad nunca está garantizada.

Qué significa esto para tu configuración

La decodificación especulativa no es magia. Solo ayuda si el modelo pequeño acierta la mayor parte del tiempo. Si el borrador falla, comprobar las predicciones hace perder tiempo.

Aun así, el soporte desde el primer día en llama.cpp y SGLang facilita las pruebas. La velocidad local importa.

Cómo probarlo por tu cuenta

No te fíes de las medias. Haz tus propias pruebas antes de cambiar tu proceso de producción.

Toma los pesos exactos de borrador y destino de DSpark para tu modelo LFM2.5. Cárgalos en tu versión actual de llama.cpp o SGLang. Ejecuta tus prompts y llamadas a funciones habituales con y sin DSpark. Mide los tokens por segundo, la memoria, la tasa de aceptación del borrador y el éxito de las llamadas a herramientas. Si la aceleración se mantiene en tu hardware y tus herramientas devuelven argumentos válidos, DSpark es una victoria clara.

← Todas las noticias