Liquid AI đang phát hành các checkpoint bản nháp DSpark cho LFM2.5-1.2B-Instruct, 2.6B và 8B-A1B, bổ sung giải mã suy đoán vào đường dẫn giải mã. Lời khẳng định rất rõ ràng: tăng thông lượng lên đến 3.18× trên một GPU H100 và lên đến 2.87× trên thiết bị, đồng thời giữ đầu ra greedy giống hệt với baseline. Sự tương đương này rất quan trọng—DSpark xác minh từng token được đề xuất—vì vậy các nhóm có thể áp dụng tăng tốc mà không làm ảnh hưởng đến các chuẩn đánh giá đã thiết lập. Với hỗ trợ ngay từ ngày đầu trong SGLang và llama.cpp, việc triển khai không chỉ là một bản demo trong phòng thí nghiệm; nó có thể chạy ngay trong các ngăn xếp suy luận phổ biến. Tác động rõ ràng nhất ở những nơi các mô hình nhỏ cần phản hồi tức thì: chat cục bộ, trợ lý lập trình và các tác vụ gọi hàm tác nhân, nơi DSpark cũng giảm đáng kể độ trễ.
Tại sao điều này lại hiệu quả bây giờ? Giải mã LLM thường bị giới hạn bởi bộ nhớ: việc liên tục truy xuất trọng số lớn từ DRAM chiếm phần lớn độ trễ. DSpark giải quyết vấn đề này bằng cách sử dụng một bộ soạn thảo nhỏ gọn đề xuất nhiều token, sau đó mô hình mục tiêu xác minh chúng trong một lần duyệt—giúp giảm tải truy xuất trọng số. Công thức của nó kết hợp một bộ khung song song kiểu DFlash với một đầu Markov nhẹ để thêm phụ thuộc giữa các token, và một bộ xác minh theo lịch trình độ tin cậy để loại bỏ các phần đuôi có độ tin cậy thấp. Bộ soạn thảo của Liquid AI có khoảng 300 triệu tham số và được huấn luyện để tối ưu tỷ lệ chấp nhận thay vì chỉ giảm thiểu mất mát, giúp đẩy nhiều token được xác minh hơn mỗi lần duyệt. Kết quả là: giảm số lần truy xuất bộ nhớ cho mỗi token phát ra, từ đó tăng thông lượng mà không thay đổi đầu ra greedy.
Hiệu suất không đồng đều trên các ngữ cảnh khác nhau. Với các mô hình nhỏ và dày đặc (1.2B–2.6B), DSpark mang lại lợi ích ổn định từ 2–3× trên GPU và tăng tốc mạnh trên thiết bị, vượt qua ngưỡng “cảm nhận tức thì” cho các ứng dụng tương tác. Mô hình MoE 8B-A1B cho thấy cải thiện đáng kể trên GPU nhưng lợi ích trên thiết bị mỏng hơn do hiệu quả backend Metal hiện tại và chi phí xác minh nhiều token trên nhiều chuyên gia hơn. Tuy nhiên, khả năng tăng số token trên giây của DSpark trên laptop làm cho trợ lý và tác nhân cục bộ hữu ích hơn đáng kể, và trong các luồng tác nhân, Liquid AI báo cáo độ trễ gọi hàm giảm hơn một nửa—một chiến thắng lớn cho các kịch bản sử dụng nhiều công cụ, nơi thời gian phản hồi là nút thắt cổ chai.
Về mặt vận hành, DSpark là một nâng cấp ít ma sát: gắn bản nháp vào mô hình mục tiêu trong SGLang hoặc sử dụng bản build llama.cpp hỗ trợ DSpark, sau đó theo dõi tỷ lệ chấp nhận và draft_n/draft_n_accepted để xác nhận lợi ích. Bắt đầu với bộ soạn thảo phù hợp với mục tiêu LFM2.5 của bạn và kích thước block vừa phải; điều chỉnh cho phù hợp với văn bản trong lĩnh vực của bạn để ổn định tỷ lệ chấp nhận. Vì giải mã suy đoán là chính xác dưới chế độ greedy, các bộ công cụ đánh giá và benchmark của bạn vẫn giữ nguyên tính so sánh. Trong sản xuất, hãy xác thực hiệu suất tác nhân toàn diện—đặc biệt là độ trễ công cụ và nhịp gọi hàm—vì ROI thực tế của DSpark lớn nhất ở những nơi các cuộc gọi công cụ đa bước chiếm phần lớn thời gian phản hồi.


