List of Best

Liquid AI phát hành mô hình thị giác 3.1B tốc độ cao cho thiết bị cục bộ và tác vụ riêng tư

Mục lục
Official announcement image: Liquid AI Releases Fast 3.1B Vision Model for Local Devices and Private Workloads
Tài nguyên nguồn: \2.

Liquid AI đã phát hành LFM2.5-VL-3B vào ngày 12 tháng 8 năm 2026. Mô hình thị giác – ngôn ngữ trọng số mở 3.1B mới này cho phép bạn phân tích hình ảnh và tài liệu trực tiếp trên phần cứng của riêng mình. Bạn có thể tải về ngay bây giờ thông qua Hugging FaceLiquid AI Playground.

Được xây dựng cho tốc độ, không phải suy nghĩ lâu

Mô hình tập trung vào các câu trả lời nhanh chóng thay vì suy luận nhiều bước chậm chạp. Thiết kế độ trễ thấp đó giúp mô hình phù hợp thực tế cho việc đọc ảnh chụp màn hình, chạy OCR trên tài liệu và tương tác với giao diện phần mềm.

Bên dưới phần cứng, kiến trúc này kết hợp bộ mã hóa thị giác 400M SigLIP2 NaFlex với phần xương sống 2.6B LFM2.5. Liquid AI đã huấn luyện mô hình trên khoảng 34T token, tích hợp lượng dữ liệu thị giác gấp bốn lần so với mô hình trước đó và vốn từ vựng 128K.

Ngay từ ngày đầu, mô hình đã hỗ trợ các runtime cục bộ được sử dụng rộng rãi:

  • llama.cpp (thông qua định dạng GGUF)
  • Apple MLX
  • vLLMSGLang
  • ONNX

Những con số hiệu năng bạn nên kiểm chứng

Liquid báo cáo rằng mô hình sử dụng khoảng 3 GB bộ nhớ. Mô hình chạy ở tốc độ 228 tokens/s trên Apple M5 Max, 116 tokens/s trên AMD Ryzen AI Max+ 395, và 20 tokens/s trên Samsung Galaxy S26 Ultra. Trên GPU H100 chạy vLLM 0.26 với BF16, Liquid tuyên bố đạt khoảng 11K output tokens/s trong điều kiện đồng thời cao với hình ảnh 512×512.

Công ty cũng công bố những bước nhảy vọt về điểm chuẩn so với LFM2-VL-3B cũ hơn:

  • ScreenSpot-v2 desktop: 78.7 (tăng từ 6.0)
  • ScreenSpot-v2 mobile: 81.2 (tăng từ 7.6)
  • ToolSandbox: 59.5 (tăng từ 26.4)
  • RefCOCO average: 87.9 (tăng từ 57.1)

Tất cả các số liệu tốc độ và điểm benchmark này đều đến trực tiếp từ các thử nghiệm nội bộ của chính Liquid AI. Chưa có ai bên ngoài công ty kiểm chứng chúng. Mức sử dụng bộ nhớ và độ chính xác thực tế có thể thay đổi đáng kể tùy thuộc vào mức lượng tử hóa chính xác, độ dài prompt và độ phân giải hình ảnh của bạn.

Vì sao thị giác cục bộ quan trọng với đội ngũ của bạn

Việc chạy các mô hình thị giác cục bộ giải quyết hai vấn đề đau đầu lớn: chi phí API đám mây và rủi ro quyền riêng tư. Nếu bạn xử lý các hóa đơn nhạy cảm hoặc màn hình ứng dụng riêng tư, việc lưu giữ dữ liệu trên thiết bị sẽ loại bỏ các nguy cơ rò rỉ bảo mật. Tốc độ ở đây cũng rất quan trọng. Khả năng suy luận cục bộ nhanh giúp các công cụ đọc màn hình luôn phản hồi nhạy bén.

Mô hình nhỏ gọn và nhanh chóng.

Kiểm thử trên phần cứng của chính bạn

Đừng vội tái cấu trúc quy trình của bạn. Hãy bắt đầu bằng một thử nghiệm nhỏ trên một máy tính xách tay dự phòng hoặc máy thử nghiệm.

Tải về trọng số LiquidAI/LFM2.5-VL-3B và chạy chúng bằng llama.cpp hoặc MLX. Đưa vào mô hình năm ảnh chụp màn hình giao diện thực tế và năm tài liệu đã quét. Đo độ trễ của token đầu tiên, mức sử dụng RAM và độ chính xác của câu trả lời so với mô hình thị giác trên nền tảng lưu trữ hiện tại của bạn. Nếu các con số này hoạt động tốt trên phần cứng của bạn, bạn sẽ có được một công cụ thị giác rẻ hơn, riêng tư và có thể chạy ở bất cứ đâu.

← Tất cả tin tức