
A Liquid AI lançou o LFM2.5-VL-3B em 12 de agosto de 2026. Este novo modelo de visão e linguagem de pesos abertos de 3.1B permite analisar imagens e documentos diretamente no seu próprio hardware. Você pode baixá-lo agora pelo Hugging Face e no Playground da Liquid AI.
Feito para velocidade, não para raciocínio longo
O modelo se concentra em respostas rápidas em vez de um raciocínio lento de várias etapas. Esse design de baixa latência o torna ideal na prática para ler capturas de tela, executar OCR em documentos e interagir com interfaces de software.
Nos bastidores, a arquitetura combina um codificador de visão SigLIP2 NaFlex de 400M com uma base LFM2.5 de 2.6B. A Liquid AI o treinou com cerca de 34T de tokens, incluindo quatro vezes mais dados visuais do que seu modelo anterior e um vocabulário de 128K.
Desde o primeiro dia, ele suporta ambientes de execução locais amplamente utilizados:
- llama.cpp (via formato GGUF)
- Apple MLX
- vLLM e SGLang
- ONNX
Os números de desempenho que você deve verificar
A Liquid relata que o modelo usa cerca de 3 GB de memória. Ele roda a 228 tokens/s em um Apple M5 Max, 116 tokens/s em um AMD Ryzen AI Max+ 395 e 20 tokens/s em um Samsung Galaxy S26 Ultra. Em uma GPU H100 executando vLLM 0.26 com BF16, a Liquid afirma alcançar cerca de 11K tokens/s de saída sob alta simultaneidade com uma imagem de 512×512.
A empresa também divulgou grandes saltos em benchmarks em comparação com o antigo LFM2-VL-3B:
- ScreenSpot-v2 desktop: 78.7 (subindo de 6.0)
- ScreenSpot-v2 mobile: 81.2 (subindo de 7.6)
- ToolSandbox: 59.5 (subindo de 26.4)
- Média RefCOCO: 87.9 (subindo de 57.1)
Todos esses números de velocidade e pontuações de benchmark vêm diretamente dos testes internos da própria Liquid AI. Ninguém de fora da empresa os verificou ainda. O uso real de memória e a precisão podem variar drasticamente com base na sua quantização exata, tamanho do prompt e resolução da imagem.
Por que a visão local importa para a sua equipe
Executar modelos de visão localmente resolve duas grandes dores de cabeça: custos com APIs na nuvem e riscos de privacidade. Se você processa faturas confidenciais ou telas de aplicativos privados, manter os dados no dispositivo elimina vazamentos de segurança. A velocidade também conta aqui. Uma inferência local rápida mantém as ferramentas de leitura de tela responsivas.
Ele é pequeno e rápido.
Teste no seu próprio hardware
Não reconstrua seu pipeline ainda. Comece com um pequeno projeto piloto em um notebook reserva ou máquina de testes.
Baixe os pesos do LiquidAI/LFM2.5-VL-3B e execute-os usando llama.cpp ou MLX. Forneça ao modelo cinco capturas de tela reais de interface de usuário e cinco documentos digitalizados. Meça a latência do primeiro token, o uso de memória RAM e a precisão das respostas em comparação com o seu modelo de visão hospedado atual. Se os números se sustentarem no seu hardware, você ganha uma ferramenta de visão mais barata e privada que roda em qualquer lugar.
