List of Best

Liquid AI lanza un modelo de visión rápido de 3.1B para dispositivos locales y cargas de trabajo privadas

Índice
Official announcement image: Liquid AI Releases Fast 3.1B Vision Model for Local Devices and Private Workloads
Recurso de origen: \2.

Liquid AI lanzó LFM2.5-VL-3B el 12 de agosto de 2026. Este nuevo modelo de visión y lenguaje de pesos abiertos de 3.1B te permite analizar imágenes y documentos directamente en tu propio hardware. Ya puedes conseguirlo a través de Hugging Face y el Playground de Liquid AI.

Diseñado para la velocidad, no para el razonamiento prolongado

El modelo se centra en respuestas rápidas en lugar de un razonamiento lento paso a paso. Ese diseño de baja latencia hace que sea ideal para leer capturas de pantalla, ejecutar OCR en documentos e interactuar con interfaces de software.

Por dentro, la arquitectura combina un codificador de visión SigLIP2 NaFlex de 400M con una base LFM2.5 de 2.6B. Liquid AI lo entrenó con aproximadamente 34T de tokens, incluyendo cuatro veces más datos de visión que su modelo anterior y un vocabulario de 128K.

Desde el primer día, es compatible con entornos de ejecución locales ampliamente utilizados:

  • llama.cpp (a través del formato GGUF)
  • Apple MLX
  • vLLM y SGLang
  • ONNX

Las cifras de rendimiento que deberías verificar

Liquid informa de que el modelo utiliza alrededor de 3 GB de memoria. Funciona a 228 tokens/s en un Apple M5 Max, a 116 tokens/s en un AMD Ryzen AI Max+ 395 y a 20 tokens/s en un Samsung Galaxy S26 Ultra. En una GPU H100 con vLLM 0.26 y BF16, Liquid afirma alcanzar unos 11K tokens/s de salida con alta concurrencia y una imagen de 512×512.

La compañía también publicó importantes mejoras en los benchmarks en comparación con el anterior LFM2-VL-3B:

  • ScreenSpot-v2 desktop: 78.7 (frente a 6.0)
  • ScreenSpot-v2 mobile: 81.2 (frente a 7.6)
  • ToolSandbox: 59.5 (frente a 26.4)
  • RefCOCO average: 87.9 (frente a 57.1)

Todas estas cifras de velocidad y puntuaciones de benchmark provienen directamente de las pruebas internas de Liquid AI. Nadie fuera de la empresa las ha verificado todavía. El uso real de memoria y la precisión pueden variar drásticamente según la cuantización exacta, la longitud del prompt y la resolución de la imagen.

Por qué la visión local es importante para tu equipo

Ejecutar modelos de visión de forma local soluciona dos grandes quebraderos de cabeza: las facturas de las API en la nube y los riesgos de privacidad. Si procesas facturas confidenciales o pantallas de aplicaciones privadas, mantener los datos en el dispositivo elimina las filtraciones de seguridad. La velocidad también cuenta aquí. La inferencia local rápida mantiene la agilidad de las herramientas de lectura de pantalla.

Es pequeño y rápido.

Pruébalo en tu propio hardware

No reconstruyas todavía tu flujo de trabajo. Empieza con una pequeña prueba piloto en un portátil de repuesto o una máquina de prueba.

Descarga los pesos de LiquidAI/LFM2.5-VL-3B y ejecútalos con llama.cpp o MLX. Pasa al modelo cinco capturas de pantalla de interfaces reales y cinco documentos escaneados. Mide la latencia del primer token, el uso de RAM y la precisión de las respuestas frente a tu modelo de visión alojado actual. Si las cifras se mantienen en tu hardware, obtendrás una herramienta de visión privada y más económica que funciona en cualquier lugar.

← Todas las noticias