
Liquid AI가 서버와 로컬 기기에서 LFM2.5 모델을 더 빠르게 실행할 수 있도록 DSpark라는 새로운 초안 체크포인트를 출시했습니다. AI 모델을 로컬에서 실행하거나 오픈소스 도구로 개발하는 경우, 이번 업데이트를 통해 최종 텍스트 출력의 변경 없이 대기 시간을 줄일 수 있습니다.
2026-08-20에 게시된 Liquid AI / Hugging Face 글에 따르면, DSpark는 LFM2.5-1.2B-Instruct, LFM2.5-2.6B, LFM2.5-8B-A1B 세 가지 모델에 추측 디코딩을 추가합니다. 이 구성에서는 작은 초안 모델이 이어질 단어를 빠르게 예측합니다. 그런 다음 주 모델이 이를 한 번에 확인합니다. 표준 그리디 디코딩 방식에서는 잘못된 초안 토큰이 주 모델에 의해 대체됩니다. 이는 최종 출력이 동일하게 유지됨을 의미합니다.
Liquid AI가 발표한 수치
Liquid AI는 여러 구성 환경에서 강력한 벤치마크 수치를 공유했습니다:
- BF16 정밀도로 실행되는 단일 Nvidia H100 80GB에서 최대 3.18배 더 높은 GPU 처리량.
- Metal에서 FP16 GGUF 가중치를 사용하는 Apple M4 Max MacBook Pro에서 최대 2.87배 빠른 온디바이스 속도.
- LFM2.5-2.6B를 사용한 함수 호출 시 평균 57% 더 낮은 지연 시간.
- Metal이 검증 중에 추가 전문가를 활성화하는 MoE 모델 LFM2.5-8B-A1B의 온디바이스에서 평균 18% 속도 향상.
통합은 오늘 바로 준비되었습니다. 이미 llama.cpp PR #27383 및 SGLang PR #31041을 통해 사용할 수 있습니다.
맹신해서는 안 되는 부분
이러한 모든 성능 수치는 Liquid AI의 내부 벤치마크에서 직접 나온 것입니다. 아직 독립적인 제3자가 테스트하지 않았습니다. Liquid AI는 블록 크기 9, 배치 크기 1, 온도 0, 최대 256개 출력 토큰, 5개의 벤치마크 데이터셋으로 테스트를 진행했습니다. 이 결과가 다른 칩, 대규모 배치 또는 창의적인 온도 설정에서도 동일한 절감 효과를 보장하지는 않습니다. Liquid AI는 또한 텍스트에 따라 1.2B 모델의 속도 향상이 최대 52%까지 차이 났다고 밝혔습니다.
속도는 절대 보장되지 않습니다.
사용자의 환경에 이것이 의미하는 바
추측 디코딩은 마법이 아닙니다. 작은 모델이 대부분의 경우 정확하게 예측할 때만 도움이 됩니다. 초안 예측이 실패하면 이를 확인하는 과정에서 시간이 낭비됩니다.
그래도 llama.cpp와 SGLang의 출시 첫날 지원 덕분에 테스트하기는 쉽습니다. 로컬 속도는 중요합니다.
직접 테스트하는 방법
평균값을 그대로 믿지 마세요. 프로덕션 파이프라인을 변경하기 전에 직접 테스트를 실행해 보세요.
사용 중인 LFM2.5 모델에 맞는 정확한 DSpark 초안 및 타깃 가중치를 준비하세요. 현재 llama.cpp 또는 SGLang 빌드에 이를 로드하세요. DSpark 사용 여부에 따라 평소 사용하는 프롬프트와 함수 호출을 실행해 보세요. 초당 토큰 수, 메모리, 초안 수락률, 도구 호출 성공률을 측정하세요. 사용자의 하드웨어에서도 속도 향상이 유지되고 도구가 올바른 인수를 반환한다면, DSpark는 손쉬운 승리입니다.
