NexusAi logo

NexusAi

  • Sản phẩm
  • Danh mục
  • Prompts
  • Tìm kiếm
  • Tin AI
  • Giá cả
  • Quảng bá
  • Liên hệ
Đăng nhập
NexusAi LogoNexusAi

NexusAI giúp bạn khám phá, so sánh và tìm hiểu các công cụ AI một cách dễ dàng. Từ những hiểu biết chuyên sâu của chuyên gia đến các tài nguyên đào tạo, chúng tôi trao quyền cho các cá nhân và doanh nghiệp khai thác công nghệ AI để đưa ra quyết định thông minh hơn, đổi mới và phát triển.

Liên kết hữu ích

  • Về chúng tôi
  • Sản phẩm AI
  • Danh mục AI
  • Câu lệnh AI
  • Tìm kiếm AI
  • Góc nhìn AI

Dịch vụ & Pháp lý

  • Quảng bá & Trưng bày
  • Gói thành viên
  • Điều khoản & Điều kiện
  • Chính sách hoàn tiền
  • Chính sách bảo mật
  • Tuyên bố miễn trừ

Liên hệ với chúng tôi

88 Tribune Street
South Brisbane, QLD, Australia, 4101
Trang web: www.nexusai-tech.com
Email: info@nexusai-tech.com

© Bản quyền 2026 NexusAi Bảo lưu mọi quyền

Phát triển bởi DStudio Technology
Trang chủ/Góc nhìn AI/Cập nhật Mô hình & Nền tảng AI/DSpark của Liquid AI Tăng Tốc LFM2.5 Lên Đến 3.2× Thông Lượng—Không Thay Đổi Đầu Ra Greedy
Cập nhật Mô hình & Nền tảng AITăng tốc suy luận

DSpark của Liquid AI Tăng Tốc LFM2.5 Lên Đến 3.2× Thông Lượng—Không Thay Đổi Đầu Ra Greedy

Liquid AI đã phát hành các checkpoint bản nháp DSpark cho LFM2.5-1.2B-Instruct, 2.6B và 8B-A1B với giải mã suy đoán giúp tăng tốc đáng kể: lên đến 3.18× trên GPU và 2.87× trên thiết bị, với chi phí bộ nhớ tối thiểu và giữ nguyên đầu ra greedy. Hỗ trợ ngay từ ngày đầu trong llama.cpp và SGLang biến đây thành nâng cấp thực tiễn cho các tác vụ biên và tác vụ tác nhân.

Nhóm Nghiên cứu NexusAi25 thg 8, 20262.1K lượt xem8 phút đọc
DSpark của Liquid AI Tăng Tốc LFM2.5 Lên Đến 3.2× Thông Lượng—Không Thay Đổi Đầu Ra Greedy
Tóm tắt AI

DSpark của Liquid AI ra mắt dưới dạng các checkpoint bản nháp cho ba mô hình LFM2.5, bổ sung đường dẫn giải mã suy đoán giữ nguyên đầu ra greedy đồng thời tăng thông lượng giải mã—đo được lên đến 3.18× trên H100 và 2.87× trên MacBook với chi phí bộ nhớ tối thiểu. DSpark kết hợp bộ khung song song, đầu tuần tự nhẹ và bộ xác minh theo lịch trình độ tin cậy để nâng cao tỷ lệ chấp nhận và giảm tải trọng số trên nhiều token. Với hỗ trợ ngay từ ngày đầu trong llama.cpp và SGLang, các nhóm có thể nhanh chóng đánh giá DSpark trong cả môi trường GPU và thiết bị. Kết luận: các mô hình nhỏ được tinh chỉnh theo hướng chỉ dẫn giờ đây có thể đạt tốc độ “tương tác” cho chat, lập trình và các vòng tác nhân—đặc biệt là gọi hàm—mà không cần huấn luyện lại hay hy sinh tính xác định đầu ra dưới chế độ greedy.

Liquid AI đang phát hành các checkpoint bản nháp DSpark cho LFM2.5-1.2B-Instruct, 2.6B và 8B-A1B, bổ sung giải mã suy đoán vào đường dẫn giải mã. Lời khẳng định rất rõ ràng: tăng thông lượng lên đến 3.18× trên một GPU H100 và lên đến 2.87× trên thiết bị, đồng thời giữ đầu ra greedy giống hệt với baseline. Sự tương đương này rất quan trọng—DSpark xác minh từng token được đề xuất—vì vậy các nhóm có thể áp dụng tăng tốc mà không làm ảnh hưởng đến các chuẩn đánh giá đã thiết lập. Với hỗ trợ ngay từ ngày đầu trong SGLang và llama.cpp, việc triển khai không chỉ là một bản demo trong phòng thí nghiệm; nó có thể chạy ngay trong các ngăn xếp suy luận phổ biến. Tác động rõ ràng nhất ở những nơi các mô hình nhỏ cần phản hồi tức thì: chat cục bộ, trợ lý lập trình và các tác vụ gọi hàm tác nhân, nơi DSpark cũng giảm đáng kể độ trễ.

Tại sao điều này lại hiệu quả bây giờ? Giải mã LLM thường bị giới hạn bởi bộ nhớ: việc liên tục truy xuất trọng số lớn từ DRAM chiếm phần lớn độ trễ. DSpark giải quyết vấn đề này bằng cách sử dụng một bộ soạn thảo nhỏ gọn đề xuất nhiều token, sau đó mô hình mục tiêu xác minh chúng trong một lần duyệt—giúp giảm tải truy xuất trọng số. Công thức của nó kết hợp một bộ khung song song kiểu DFlash với một đầu Markov nhẹ để thêm phụ thuộc giữa các token, và một bộ xác minh theo lịch trình độ tin cậy để loại bỏ các phần đuôi có độ tin cậy thấp. Bộ soạn thảo của Liquid AI có khoảng 300 triệu tham số và được huấn luyện để tối ưu tỷ lệ chấp nhận thay vì chỉ giảm thiểu mất mát, giúp đẩy nhiều token được xác minh hơn mỗi lần duyệt. Kết quả là: giảm số lần truy xuất bộ nhớ cho mỗi token phát ra, từ đó tăng thông lượng mà không thay đổi đầu ra greedy.

Hiệu suất không đồng đều trên các ngữ cảnh khác nhau. Với các mô hình nhỏ và dày đặc (1.2B–2.6B), DSpark mang lại lợi ích ổn định từ 2–3× trên GPU và tăng tốc mạnh trên thiết bị, vượt qua ngưỡng “cảm nhận tức thì” cho các ứng dụng tương tác. Mô hình MoE 8B-A1B cho thấy cải thiện đáng kể trên GPU nhưng lợi ích trên thiết bị mỏng hơn do hiệu quả backend Metal hiện tại và chi phí xác minh nhiều token trên nhiều chuyên gia hơn. Tuy nhiên, khả năng tăng số token trên giây của DSpark trên laptop làm cho trợ lý và tác nhân cục bộ hữu ích hơn đáng kể, và trong các luồng tác nhân, Liquid AI báo cáo độ trễ gọi hàm giảm hơn một nửa—một chiến thắng lớn cho các kịch bản sử dụng nhiều công cụ, nơi thời gian phản hồi là nút thắt cổ chai.

Về mặt vận hành, DSpark là một nâng cấp ít ma sát: gắn bản nháp vào mô hình mục tiêu trong SGLang hoặc sử dụng bản build llama.cpp hỗ trợ DSpark, sau đó theo dõi tỷ lệ chấp nhận và draft_n/draft_n_accepted để xác nhận lợi ích. Bắt đầu với bộ soạn thảo phù hợp với mục tiêu LFM2.5 của bạn và kích thước block vừa phải; điều chỉnh cho phù hợp với văn bản trong lĩnh vực của bạn để ổn định tỷ lệ chấp nhận. Vì giải mã suy đoán là chính xác dưới chế độ greedy, các bộ công cụ đánh giá và benchmark của bạn vẫn giữ nguyên tính so sánh. Trong sản xuất, hãy xác thực hiệu suất tác nhân toàn diện—đặc biệt là độ trễ công cụ và nhịp gọi hàm—vì ROI thực tế của DSpark lớn nhất ở những nơi các cuộc gọi công cụ đa bước chiếm phần lớn thời gian phản hồi.

Điểm mấu chốt

Tương Đương Greedy Với Tốc Độ Thực

DSpark xác minh từng token được đề xuất, vì vậy giải mã greedy khớp với đầu ra baseline trong khi đạt thông lượng lên đến 3.2× trên GPU và tăng tốc mạnh trên thiết bị—lý tưởng cho những nơi cả độ chính xác và độ phản hồi đều quan trọng.

Ưu Tiên Cho Tác Vụ Biên Và Tác Vụ Tác Nhân

Các mô hình LFM2.5 nhỏ và dày đặc đạt tốc độ tương tác cục bộ, và các luồng tác nhân đa công cụ thấy thời gian phản hồi giảm đáng kể khi DSpark cắt giảm độ trễ gọi hàm hơn một nửa trung bình.

Áp Dụng Nhanh, Đo Lường Thông Minh

Gắn bản nháp DSpark, theo dõi tỷ lệ chấp nhận và draft_n_accepted, và đánh giá số token trên mỗi đô la cùng độ trễ đầu-cuối. Kỳ vọng lợi ích trên thiết bị mỏng hơn cho MoE cho đến khi kernel Metal và lịch trình trưởng thành.

Liquid AI Vừa Ra Mắt Gì—Và Tại Sao Quan Trọng

Các checkpoint bản nháp DSpark cho ba mô hình LFM2.5 cho phép giải mã suy đoán tăng thông lượng mà không thay đổi đầu ra greedy. Lợi ích rõ ràng cho cả đám mây và biên: đo được lên đến 3.18× trên H100 và 2.87× trên thiết bị loại MacBook với bộ nhớ bổ sung tối thiểu. Với hỗ trợ ngay từ ngày đầu trong SGLang và llama.cpp, DSpark không phải là một nhánh nghiên cứu thuần túy; nó gần với sản xuất. Đối với các nhà sáng lập và nhóm nền tảng ưu tiên độ phản hồi và chi phí, điều này cho phép các mô hình nhỏ hơn đạt tốc độ tương tác trong lập trình, chat và vòng tác nhân—giảm áp lực phải mở rộng mô hình lớn hơn chỉ vì lý do độ trễ.

DSpark Tăng Thông Lượng Như Thế Nào Trong Khi Giữ Nguyên Đầu Ra Greedy

Giải mã suy đoán giải quyết nút thắt giải mã bị giới hạn bộ nhớ bằng cách đề xuất nhiều token qua một bộ soạn thảo nhẹ và xác minh chúng trong một lần duyệt trên mô hình mục tiêu. Sự kết hợp của DSpark—bộ khung song song cho tất cả token dự thảo, đầu Markov tuần tự để tăng tỷ lệ chấp nhận vị trí sau, và bộ xác minh theo lịch trình độ tin cậy để loại bỏ các phần đuôi có độ tin cậy thấp—đẩy nhiều token được chấp nhận hơn mỗi lần xác minh. Liquid AI huấn luyện các bộ soạn thảo khoảng 300 triệu tham số được tinh chỉnh cho tỷ lệ chấp nhận, không chỉ giảm thiểu mất mát. Dưới giải mã greedy, các đề xuất bị từ chối được thay thế bằng lựa chọn của mô hình mục tiêu, vì vậy các token phát ra giống hệt baseline. Kết quả: giảm số lần truy xuất bộ nhớ cho mỗi token phát ra và tăng số token trên giây mà không thay đổi đầu ra.

Nơi DSpark Giúp Nhiều Nhất: GPU So Với Thiết Bị Và Lưu Ý Về MoE

Đối với các mô hình dày đặc 1–3 tỷ tham số, DSpark thường xuyên mang lại tăng thông lượng 2–3× trên GPU và hơn 2× trên laptop hiện đại—đủ để cải thiện trải nghiệm chat và lập trình cũng như tăng tốc các vòng tác nhân. Tăng tốc trên thiết bị cho biến thể MoE 8B-A1B mỏng hơn do hiệu quả backend Metal hiện tại và chi phí xác minh nhiều token trên nhiều chuyên gia. Nếu khối lượng công việc của bạn sử dụng nhiều công cụ, việc giảm trung bình 57% độ trễ gọi hàm là rất có giá trị. Tóm lại: chọn DSpark cho các mô hình nhỏ đến trung bình hướng đến trải nghiệm người dùng tương tác hoặc phục vụ nhạy cảm với chi phí; với MoE trên thiết bị, kỳ vọng có lợi ích nhưng nên dự trù thận trọng cho đến khi kernel và backend được cải thiện.

Hướng Dẫn Tích Hợp: Từ Phòng Thí Nghiệm Đến Độ Tin Cậy Sản Xuất

Áp dụng DSpark bằng cách ghép mô hình LFM2.5 mục tiêu với bản nháp tương ứng trong SGLang hoặc bản build llama.cpp hỗ trợ DSpark. Bắt đầu với kích thước block bản nháp mặc định và xác nhận lợi ích bằng cách theo dõi tỷ lệ chấp nhận và draft_n so với draft_n_accepted. Đánh giá trên hỗn hợp lưu lượng thực tế của bạn—chat, lập trình, toán học và sử dụng công cụ—để tránh quá khớp với một tập dữ liệu duy nhất. Với triển khai trên thiết bị, kiểm tra dung lượng bộ nhớ còn lại với phương pháp lượng tử hóa và độ dài ngữ cảnh đã chọn. Trong sản xuất, theo dõi độ trễ tác nhân đầu-cuối và số token trên mỗi đô la, không chỉ số token trên giây thô, để nắm bắt ảnh hưởng của DSpark đến thời gian phản hồi gọi hàm và độ nhạy cảm tổng thể của người dùng.

Giới Hạn, Rủi Ro Và Những Điều Cần Theo Dõi Tiếp Theo

Sự tương đương đầu ra greedy của DSpark không áp dụng cho các thiết lập không greedy; việc lấy mẫu với nhiệt độ hoặc nucleus thay đổi động lực chấp nhận và có thể gây lệch đầu ra, vì vậy hãy sử dụng giải mã xác định khi cần tương đương. Trên các mô hình MoE, việc xác minh nhiều token có thể kích hoạt nhiều chuyên gia hơn và làm bão hòa băng thông bộ nhớ, làm giảm tốc độ tăng trên thiết bị cho đến khi kernel được cải thiện. Có một chút chi phí bộ nhớ từ bản nháp; hãy dự trù cùng với độ dài ngữ cảnh và bộ nhớ đệm KV. Cuối cùng, theo dõi sự hỗ trợ từ trên xuống trong SGLang và llama.cpp; khi kernel và lịch trình cải thiện—đặc biệt trên Metal—khoảng cách hiệu suất trên thiết bị cho MoE sẽ thu hẹp.

Câu hỏi thường gặp

DSpark có làm thay đổi câu trả lời của mô hình tôi không?

Dưới giải mã greedy, không—bộ xác minh của DSpark đảm bảo chuỗi token phát ra khớp với mô hình mục tiêu. Nếu bạn bật lấy mẫu (nhiệt độ, nucleus), động lực chấp nhận thay đổi và đầu ra có thể khác biệt; hãy giữ thiết lập giải mã xác định khi cần tương đương.

Bản nháp thêm bao nhiêu bộ nhớ, và lượng tử hóa có giúp không?

Bộ soạn thảo có khoảng vài trăm triệu tham số, thêm một chi phí bộ nhớ vừa phải so với mô hình mục tiêu. Các bản build GGUF lượng tử hóa giảm thêm dung lượng, rất hữu ích trên laptop và thiết bị biên với ngân sách bộ nhớ hạn chế.

Tôi nên đo gì để xác thực DSpark trong sản xuất?

Theo dõi tỷ lệ chấp nhận, số token trên giây, và draft_n so với draft_n_accepted. Để đánh giá ROI thực sự, đo độ trễ đầu-cuối (đặc biệt là gọi hàm), số token trên mỗi đô la và độ nhạy cảm người dùng trên khối lượng công việc thực tế.

#Giải mã phỏng đoán#Độ trễ suy luận#Số token mỗi giây#Suy luận trên thiết bị#Suy luận tại biên#llama.cpp#Điểm Kết Nối Tương Thích Với OpenAI#Hỗn hợp chuyên gia (MoE)#Tăng tốc H100#Tăng Quy Mô Tính Toán Thời Gian Thử Nghiệm#Mô hình ngôn ngữ trọng số mở#Suy luận trực tiếp#Suy luận Thời gian Thực#SGLang#Độ trễ khi gọi hàm#Tỷ lệ chấp nhận#Thông lượng Token#Mẫu Bản Nháp

Bản tin Góc nhìn AI

Nhận các cập nhật AI, tin tức công cụ và góc nhìn mới nhất được gửi đến hộp thư của bạn.

Không spam. Hủy đăng ký bất cứ lúc nào.
Trên trang này
1.Liquid AI Vừa Ra Mắt Gì—Và Tại Sao Quan Trọng2.DSpark Tăng Thông Lượng Như Thế Nào Trong Khi Giữ Nguyên Đầu Ra Greedy3.Nơi DSpark Giúp Nhiều Nhất: GPU So Với Thiết Bị Và Lưu Ý Về MoE4.Hướng Dẫn Tích Hợp: Từ Phòng Thí Nghiệm Đến Độ Tin Cậy Sản Xuất5.Giới Hạn, Rủi Ro Và Những Điều Cần Theo Dõi Tiếp Theo
Chia sẻ bài viết này

Bài viết liên quan

Router của Ramp Biến Lựa Chọn LLM Thành Lớp Tối Ưu Hóa Chi Phí, Chất Lượng và Độ Trễ
Tin tức Sản phẩm AI

Router của Ramp Biến Lựa Chọn LLM Thành Lớp Tối Ưu Hóa Chi Phí, Chất Lượng và Độ Trễ

21 thg 8, 2026

Giá Đỡ Chính Là Hệ Thống: Cuộc Cạnh Tranh Hạ Tầng AI Vượt Ra Ngoài Chip
Tin tức Chung về Ngành AI

Giá Đỡ Chính Là Hệ Thống: Cuộc Cạnh Tranh Hạ Tầng AI Vượt Ra Ngoài Chip

6 thg 8, 2026

Kiểm Soát Tiến Độ: Xây Dựng Phanh Cho AI Tự Cải Thiện Trước Khi Vượt Qua An Toàn
Cập nhật Mô hình & Nền tảng AI

Kiểm Soát Tiến Độ: Xây Dựng Phanh Cho AI Tự Cải Thiện Trước Khi Vượt Qua An Toàn

29 thg 7, 2026

Khám Phá Lỗ Hổng Tăng Tốc Bằng AI Đang Gây Quá Tải Cho Hoạt Động Patch Tuesday
Tin tức Chung về Ngành AI

Khám Phá Lỗ Hổng Tăng Tốc Bằng AI Đang Gây Quá Tải Cho Hoạt Động Patch Tuesday

20 thg 7, 2026

ZML LLMD Nhắm Đến Phân Tích LLM Đa Chip Không Bị Khóa Bởi Nvidia
Tin tức Sản phẩm AI

ZML LLMD Nhắm Đến Phân Tích LLM Đa Chip Không Bị Khóa Bởi Nvidia

9 thg 7, 2026

Công cụ AI liên quan

Xem tất cả
Liquid AI: Mô Hình Nền Tảng Gốc Thiết Bị cho Suy Luận Biên và Trên Thiết Bị

Liquid AI: Mô Hình Nền Tảng Gốc Thiết Bị cho Suy Luận Biên và Trên Thiết Bị

Cơ sở hạ tầng & Phần cứng AI