List of Best

Liquid AI lance un modèle de vision rapide de 3.1B pour les appareils locaux et les charges de travail privées

Sommaire
Official announcement image: Liquid AI Releases Fast 3.1B Vision Model for Local Devices and Private Workloads
Source asset : \2.

Liquid AI a publié LFM2.5-VL-3B le 12 août 2026. Ce nouveau modèle vision-langage open-weight de 3.1B vous permet d’analyser des images et des documents directement sur votre propre matériel. Vous pouvez le récupérer dès maintenant via Hugging Face et le Playground de Liquid AI.

Conçu pour la vitesse, pas pour une longue réflexion

Le modèle se concentre sur des réponses rapides plutôt que sur un raisonnement lent en plusieurs étapes. Cette conception à faible latence en fait un choix pratique pour lire des captures d’écran, exécuter de l’OCR sur des documents et interagir avec des interfaces logicielles.

Sous le capot, l’architecture associe un encodeur de vision SigLIP2 NaFlex de 400M à un backbone LFM2.5 de 2.6B. Liquid AI l’a entraîné sur environ 34T de tokens, intégrant quatre fois plus de données de vision que son modèle précédent et un vocabulaire de 128K.

Dès le premier jour, il prend en charge des moteurs d’exécution locaux largement utilisés :

  • llama.cpp (via le format GGUF)
  • Apple MLX
  • vLLM et SGLang
  • ONNX

Les chiffres de performance que vous devriez vérifier

Liquid indique que le modèle utilise environ 3 GB de mémoire. Il fonctionne à 228 tokens/s sur un Apple M5 Max, 116 tokens/s sur un AMD Ryzen AI Max+ 395 et 20 tokens/s sur un Samsung Galaxy S26 Ultra. Sur un GPU H100 exécutant vLLM 0.26 avec BF16, Liquid annonce environ 11K tokens/s en sortie sous forte concurrence avec une image de 512×512.

L’entreprise a également affiché de nettes progressions dans les benchmarks par rapport à l’ancien LFM2-VL-3B :

  • ScreenSpot-v2 desktop : 78.7 (en hausse par rapport à 6.0)
  • ScreenSpot-v2 mobile : 81.2 (en hausse par rapport à 7.6)
  • ToolSandbox : 59.5 (en hausse par rapport à 26.4)
  • RefCOCO average : 87.9 (en hausse par rapport à 57.1)

Tous ces chiffres de vitesse et scores de benchmark proviennent directement des tests internes de Liquid AI. Personne en dehors de l’entreprise ne les a encore vérifiés. L’utilisation réelle de la mémoire et la précision peuvent varier considérablement selon votre quantification exacte, la longueur du prompt et la résolution de l’image.

Pourquoi la vision locale est importante pour votre équipe

Exécuter des modèles de vision localement résout deux problèmes majeurs : les factures d’API cloud et les risques de confidentialité. Si vous traitez des factures sensibles ou des écrans d’applications privés, conserver les données sur l’appareil élimine les fuites de sécurité. La vitesse compte aussi. Une inférence locale rapide permet aux outils de lecture d’écran de rester réactifs.

Il est petit et rapide.

Testez-le sur votre propre matériel

Ne reconstruisez pas encore votre pipeline. Commencez par un petit projet pilote sur un ordinateur portable disponible ou une machine de test.

Téléchargez les poids de LiquidAI/LFM2.5-VL-3B et exécutez-les à l’aide de llama.cpp ou MLX. Fournissez au modèle cinq vraies captures d’écran d’interface utilisateur et cinq documents numérisés. Mesurez la latence du premier token, l’utilisation de la RAM et la précision des réponses par rapport à votre modèle de vision hébergé actuel. Si les chiffres se confirment sur votre matériel, vous obtenez un outil de vision plus économique, privé et capable de fonctionner partout.

← Toute l'actualité