List of Best

Liquid AI lança modelo de visão rápido de 3.1B para dispositivos locais e cargas de trabalho privadas

Sumário
Official announcement image: Liquid AI Releases Fast 3.1B Vision Model for Local Devices and Private Workloads
Recurso de origem: \2.

A Liquid AI lançou o LFM2.5-VL-3B em 12 de agosto de 2026. Este novo modelo de visão e linguagem de pesos abertos de 3.1B permite analisar imagens e documentos diretamente no seu próprio hardware. Você pode baixá-lo agora pelo Hugging Face e no Playground da Liquid AI.

Feito para velocidade, não para raciocínio longo

O modelo se concentra em respostas rápidas em vez de um raciocínio lento de várias etapas. Esse design de baixa latência o torna ideal na prática para ler capturas de tela, executar OCR em documentos e interagir com interfaces de software.

Nos bastidores, a arquitetura combina um codificador de visão SigLIP2 NaFlex de 400M com uma base LFM2.5 de 2.6B. A Liquid AI o treinou com cerca de 34T de tokens, incluindo quatro vezes mais dados visuais do que seu modelo anterior e um vocabulário de 128K.

Desde o primeiro dia, ele suporta ambientes de execução locais amplamente utilizados:

  • llama.cpp (via formato GGUF)
  • Apple MLX
  • vLLM e SGLang
  • ONNX

Os números de desempenho que você deve verificar

A Liquid relata que o modelo usa cerca de 3 GB de memória. Ele roda a 228 tokens/s em um Apple M5 Max, 116 tokens/s em um AMD Ryzen AI Max+ 395 e 20 tokens/s em um Samsung Galaxy S26 Ultra. Em uma GPU H100 executando vLLM 0.26 com BF16, a Liquid afirma alcançar cerca de 11K tokens/s de saída sob alta simultaneidade com uma imagem de 512×512.

A empresa também divulgou grandes saltos em benchmarks em comparação com o antigo LFM2-VL-3B:

  • ScreenSpot-v2 desktop: 78.7 (subindo de 6.0)
  • ScreenSpot-v2 mobile: 81.2 (subindo de 7.6)
  • ToolSandbox: 59.5 (subindo de 26.4)
  • Média RefCOCO: 87.9 (subindo de 57.1)

Todos esses números de velocidade e pontuações de benchmark vêm diretamente dos testes internos da própria Liquid AI. Ninguém de fora da empresa os verificou ainda. O uso real de memória e a precisão podem variar drasticamente com base na sua quantização exata, tamanho do prompt e resolução da imagem.

Por que a visão local importa para a sua equipe

Executar modelos de visão localmente resolve duas grandes dores de cabeça: custos com APIs na nuvem e riscos de privacidade. Se você processa faturas confidenciais ou telas de aplicativos privados, manter os dados no dispositivo elimina vazamentos de segurança. A velocidade também conta aqui. Uma inferência local rápida mantém as ferramentas de leitura de tela responsivas.

Ele é pequeno e rápido.

Teste no seu próprio hardware

Não reconstrua seu pipeline ainda. Comece com um pequeno projeto piloto em um notebook reserva ou máquina de testes.

Baixe os pesos do LiquidAI/LFM2.5-VL-3B e execute-os usando llama.cpp ou MLX. Forneça ao modelo cinco capturas de tela reais de interface de usuário e cinco documentos digitalizados. Meça a latência do primeiro token, o uso de memória RAM e a precisão das respostas em comparação com o seu modelo de visão hospedado atual. Se os números se sustentarem no seu hardware, você ganha uma ferramenta de visão mais barata e privada que roda em qualquer lugar.

← Todas as notícias