
Liquid AI đã phát hành các checkpoint bản nháp mới mang tên DSpark để giúp các mô hình LFM2.5 chạy nhanh hơn trên máy chủ và thiết bị cục bộ. Nếu bạn chạy các mô hình AI cục bộ hoặc xây dựng bằng các công cụ mã nguồn mở, bản cập nhật này có thể giảm thời gian chờ đợi mà không làm thay đổi văn bản đầu ra cuối cùng.
Theo một bài đăng của Liquid AI / Hugging Face được xuất bản vào 2026-08-20, DSpark bổ sung speculative decoding cho ba mô hình: LFM2.5-1.2B-Instruct, LFM2.5-2.6B và LFM2.5-8B-A1B. Trong thiết lập này, một mô hình nháp nhỏ sẽ dự đoán nhanh các từ tiếp theo. Sau đó, mô hình chính sẽ kiểm tra chúng trong một lượt. Theo cơ chế greedy decoding tiêu chuẩn, bất kỳ token nháp nào không đạt chuẩn đều được thay thế bởi mô hình chính. Điều này có nghĩa là kết quả đầu ra cuối cùng vẫn hoàn toàn giống nhau.
Những con số Liquid AI báo cáo
Liquid AI đã chia sẻ những con số benchmark ấn tượng trên nhiều thiết lập:
- Thông lượng GPU cao hơn tới 3.18x trên một GPU Nvidia H100 80GB duy nhất chạy ở độ chính xác BF16.
- Tốc độ trên thiết bị nhanh hơn tới 2.87x trên Apple M4 Max MacBook Pro sử dụng trọng số FP16 GGUF trong Metal.
- Độ trễ trung bình thấp hơn 57% đối với function calling với LFM2.5-2.6B.
- Tăng tốc trung bình 18% trên thiết bị đối với mô hình MoE LFM2.5-8B-A1B, nơi Metal hiện kích hoạt thêm các expert trong quá trình xác minh.
Khả năng tích hợp đã sẵn sàng ngay hôm nay. Bạn có thể sử dụng ngay qua llama.cpp PR #27383 và SGLang PR #31041.
Phần bạn không nên tin tưởng mù quáng
Tất cả các con số hiệu năng này đều đến trực tiếp từ các bài kiểm tra nội bộ của Liquid AI. Chưa có bên thứ ba độc lập nào thử nghiệm chúng. Liquid AI đã thực hiện các thử nghiệm với block size 9, batch size 1, temperature 0, tối đa 256 token đầu ra và năm tập dữ liệu benchmark. Kết quả không đảm bảo mức cải thiện tương tự trên các chip khác nhau, trong các batch lớn hoặc với các thiết lập temperature sáng tạo. Liquid AI cũng lưu ý rằng mức tăng tốc trên mô hình 1.2B có sự chênh lệch lên tới 52% tùy thuộc vào văn bản.
Tốc độ không bao giờ được đảm bảo.
Điều này có ý nghĩa gì đối với hệ thống của bạn
Speculative decoding không phải là phép thuật. Nó chỉ hữu ích nếu mô hình nhỏ đoán đúng phần lớn thời gian. Nếu bản nháp thất bại, việc kiểm tra các dự đoán sẽ gây lãng phí thời gian.
Dẫu vậy, việc hỗ trợ ngay từ ngày đầu trong llama.cpp và SGLang giúp việc thử nghiệm trở nên dễ dàng. Tốc độ cục bộ là yếu tố quan trọng.
Cách tự mình thử nghiệm
Đừng tin vào các con số trung bình. Hãy tự chạy thử nghiệm trước khi thay đổi quy trình sản xuất của bạn.
Hãy lấy đúng các trọng số draft và target của DSpark cho mô hình LFM2.5 của bạn. Tải chúng vào bản dựng llama.cpp hoặc SGLang hiện tại. Chạy các câu prompt và lệnh gọi hàm thông thường khi có và không có DSpark. Đo lường số token mỗi giây, bộ nhớ, tỷ lệ chấp nhận bản nháp và tỷ lệ thành công của lệnh gọi công cụ. Nếu tốc độ tăng vẫn duy trì trên phần cứng của bạn và các công cụ trả về đối số hợp lệ, DSpark là một giải pháp mang lại lợi ích rõ ràng.
