List of Best

Liquid AI rilascia un veloce modello di visione da 3.1B per dispositivi locali e carichi di lavoro privati

Indice
Official announcement image: Liquid AI Releases Fast 3.1B Vision Model for Local Devices and Private Workloads
Source asset: \2.

Liquid AI ha rilasciato LFM2.5-VL-3B il August 12, 2026. Questo nuovo modello vision-language a pesi aperti da 3.1B ti consente di analizzare immagini e documenti direttamente sul tuo hardware. Puoi scaricarlo subito tramite Hugging Face e il Playground di Liquid AI.

Progettato per la velocità, non per un lungo ragionamento

Il modello punta su risposte rapide anziché su un lento ragionamento a più passaggi. Il design a bassa latenza lo rende ideale per leggere screenshot, eseguire l’OCR sui documenti e interagire con le interfacce software.

Sotto il cofano, l’architettura abbina un vision encoder SigLIP2 NaFlex da 400M a un backbone LFM2.5 da 2.6B. Liquid AI lo ha addestrato su circa 34T di token, integrando quattro volte più dati visivi rispetto al suo modello precedente e un vocabolario da 128K.

Fin dal primo giorno, supporta runtime locali ampiamente utilizzati:

  • llama.cpp (tramite formato GGUF)
  • Apple MLX
  • vLLM e SGLang
  • ONNX

I numeri sulle prestazioni che dovresti verificare

Liquid riferisce che il modello utilizza circa 3 GB di memoria. Viaggia a 228 tokens/s su un Apple M5 Max, 116 tokens/s su un AMD Ryzen AI Max+ 395 e 20 tokens/s su un Samsung Galaxy S26 Ultra. Su una GPU H100 con vLLM 0.26 in BF16, Liquid dichiara circa 11K output tokens/s in condizioni di elevata concorrenza con un’immagine 512×512.

L’azienda ha anche mostrato notevoli miglioramenti nei benchmark rispetto al precedente LFM2-VL-3B:

  • ScreenSpot-v2 desktop: 78.7 (in aumento da 6.0)
  • ScreenSpot-v2 mobile: 81.2 (in aumento da 7.6)
  • ToolSandbox: 59.5 (in aumento da 26.4)
  • RefCOCO average: 87.9 (in aumento da 57.1)

Tutti questi dati sulla velocità e i punteggi dei benchmark provengono direttamente dai test interni di Liquid AI. Nessuno all’esterno dell’azienda li ha ancora verificati. L’utilizzo effettivo della memoria e l’accuratezza possono variare notevolmente in base alla quantizzazione esatta, alla lunghezza del prompt e alla risoluzione dell’immagine.

Perché la visione locale è importante per il tuo team

Eseguire modelli di visione in locale risolve due problemi principali: i costi delle API cloud e i rischi per la privacy. Se elabori fatture sensibili o schermate di app private, mantenere i dati sul dispositivo elimina le violazioni della sicurezza. Anche la velocità conta: una rapida inferenza locale mantiene reattivi gli strumenti di lettura dello schermo.

È piccolo e veloce.

Provalo sul tuo hardware

Non ricostruire ancora la tua pipeline. Inizia con un piccolo progetto pilota su un laptop di riserva o su una macchina di test.

Scarica i pesi LiquidAI/LFM2.5-VL-3B ed eseguili usando llama.cpp o MLX. Fornisci al modello cinque screenshot reali di interfacce utente e cinque documenti scansionati. Misura la latenza del primo token, l’utilizzo della RAM e l’accuratezza delle risposte rispetto al tuo attuale modello di visione in hosting. Se i numeri reggono sul tuo hardware, otterrai uno strumento di visione privato e più economico che funziona ovunque.

← Tutte le notizie