
Liquid AI가 2026년 8월 12일에 LFM2.5-VL-3B를 출시했습니다. 이 새로운 3.1B 오픈 웨이트 비전-언어 모델을 통해 자체 하드웨어에서 이미지와 문서를 직접 분석할 수 있습니다. 지금 Hugging Face와 Liquid AI Playground를 통해 이용할 수 있습니다.
긴 추론이 아닌 빠른 속도를 위한 설계
이 모델은 느린 다단계 추론 대신 빠른 답변에 중점을 둡니다. 이러한 저지연 설계 덕분에 스크린샷 판독, 문서 OCR 실행, 소프트웨어 인터페이스와의 상호 작용에 실용적으로 적합합니다.
내부적으로는 400M SigLIP2 NaFlex 비전 인코더와 2.6B LFM2.5 백본을 결합한 아키텍처를 갖추고 있습니다. Liquid AI는 이전 모델보다 4배 더 많은 비전 데이터와 128K 어휘를 포함하여 약 34T 토큰으로 이 모델을 훈련했습니다.
출시 첫날부터 널리 사용되는 로컬 런타임을 지원합니다:
- llama.cpp (GGUF 형식을 통해)
- Apple MLX
- vLLM 및 SGLang
- ONNX
직접 확인해야 할 성능 수치
Liquid에 따르면 이 모델은 약 3 GB의 메모리를 사용합니다. Apple M5 Max에서 228 tokens/s, AMD Ryzen AI Max+ 395에서 116 tokens/s, Samsung Galaxy S26 Ultra에서 20 tokens/s로 실행됩니다. BF16이 적용된 vLLM 0.26을 실행하는 H100 GPU에서는 512×512 이미지를 처리할 때 높은 동시 처리 환경에서 약 11K 출력 tokens/s에 달한다고 Liquid는 밝혔습니다.
또한 회사는 이전 LFM2-VL-3B 대비 벤치마크에서 큰 향상을 보였다고 발표했습니다:
- ScreenSpot-v2 desktop: 78.7 (6.0에서 상승)
- ScreenSpot-v2 mobile: 81.2 (7.6에서 상승)
- ToolSandbox: 59.5 (26.4에서 상승)
- RefCOCO average: 87.9 (57.1에서 상승)
이 모든 속도 수치와 벤치마크 점수는 Liquid AI의 자체 내부 테스트에서 나온 결과입니다. 아직 회사 외부에서 이를 검증한 곳은 없습니다. 실제 메모리 사용량과 정확도는 정확한 양자화, 프롬프트 길이 및 이미지 해상도에 따라 크게 달라질 수 있습니다.
로컬 비전이 팀에 중요한 이유
비전 모델을 로컬에서 실행하면 클라우드 API 비용과 개인정보 보호 위험이라는 두 가지 큰 문제를 해결할 수 있습니다. 민감한 청구서나 비공개 앱 화면을 처리할 때 데이터를 기기 내에 보관하면 보안 유출을 방지할 수 있습니다. 속도 역시 중요합니다. 빠른 로컬 추론은 화면 판독 도구의 반응 속도를 민첩하게 유지해 줍니다.
작고 빠릅니다.
자체 하드웨어에서 직접 테스트해 보세요
아직 파이프라인을 완전히 개편하지는 마세요. 여분의 노트북이나 테스트 머신에서 소규모 파일럿으로 시작해 보세요.
LiquidAI/LFM2.5-VL-3B 가중치를 다운로드하고 llama.cpp 또는 MLX를 사용하여 실행해 보세요. 모델에 5개의 실제 UI 스크린샷과 5개의 스캔 문서를 입력해 보세요. 현재 사용 중인 호스팅 비전 모델과 비교하여 첫 번째 토큰 지연 시간, RAM 사용량 및 답변 정확도를 측정해 보세요. 자체 하드웨어에서도 이 수치가 유지된다면, 어디서나 실행 가능한 더 저렴하고 안전한 프라이빗 비전 도구를 확보하게 되는 것입니다.
