Liquid AIはLFM2.5-1.2B-Instruct、2.6B、8B-A1B向けにDSparkドラフトチェックポイントを提供し、デコードパスに推測デコーディングを追加しました。主張は明快で、単一のH100で最大3.18倍、デバイス上で最大2.87倍のスループットを実現しつつ、貪欲出力は基準と同一に保ちます。この同等性は重要で、DSparkは提案されたすべてのトークンを検証するため、チームは評価基準を損なうことなく高速化を採用できます。SGLangとllama.cppで初日から対応しており、単なる研究デモではなく、一般的な推論スタックで即座に実行可能です。特に小型モデルが即時応答を求められるローカルチャット、コーディングアシスタント、エージェント機能呼び出しで効果が顕著で、DSparkはレイテンシも大幅に削減します。
なぜ今これが可能なのか?LLMのデコーディングは多くの場合メモリ帯域に制約されており、大きな重みをDRAMから繰り返し読み出すことがレイテンシの主因です。DSparkはコンパクトなドラフターを使って複数トークンを提案し、ターゲットモデルが一度のパスでそれらを検証することで重みのトラフィックを分散させます。手法はDFlashスタイルの並列バックボーンと、トークン間依存を加える軽量なマルコフヘッド、そして低信頼度のサフィックスを剪定する信頼度スケジュール検証器を組み合わせています。Liquid AIのドラフターは約3億パラメータで、純粋な損失ではなく受理率を重視して訓練されており、一度の検証でより多くのトークンを認めます。その結果、発行トークンあたりのメモリ往復回数が減り、貪欲出力を変えずにスループットが向上します。
性能はコンテキストによって均一ではありません。小型の密モデル(1.2B〜2.6B)では、DSparkはGPUで一貫して2〜3倍の性能向上を示し、インタラクティブな使用に十分な「即時感」を超える強力なデバイス上の高速化も実現します。8B-A1BのMoEモデルはGPUで堅調な向上を示す一方、Metal MoEの現状の効率や複数トークンを多くのエキスパートで検証するコストによりデバイス上の改善は控えめです。それでもDSparkはノートパソコンでのトークン処理速度を上げ、ローカルアシスタントやエージェントの実用性を大きく高めています。エージェントフローでは関数呼び出しのレイテンシが平均で半分以上短縮されており、ターンタイムがボトルネックとなるツール多用シナリオで大きな成果です。
運用面ではDSparkは低摩擦のアップグレードです。SGLangでターゲットモデルにドラフトを付加するか、DSpark対応のllama.cppビルドを使い、受理率やdraft_n/draft_n_acceptedを監視して効果を検証します。LFM2.5のターゲットに合ったドラフターと適度なブロックサイズから始め、ドメインテキストに合わせて受理率を安定させてください。推測デコーディングは貪欲法下で厳密なので、評価ハーネスやベンチマークは基準と完全に一致します。実運用ではエージェントのパフォーマンスをエンドツーエンドで検証し、特にツールのレイテンシや関数呼び出しの頻度を注視してください。DSparkの実質的なROIは多段階ツール呼び出しが応答時間の大部分を占める場面で最大となります。


