Liquid AI liefert DSpark-Draft-Checkpoints für LFM2.5-1.2B-Instruct, 2.6B und 8B-A1B, die spekulatives Decoding in den Decodierpfad integrieren. Die Aussage ist klar: bis zu 3,18× Durchsatz auf einer einzelnen H100 und bis zu 2,87× auf dem Gerät, während die Greedy-Ausgaben identisch zum Basiswert bleiben. Diese Parität ist wichtig – DSpark überprüft jeden vorgeschlagenen Token – sodass Teams die Beschleunigung übernehmen können, ohne etablierte Evaluations-Benchmarks zu gefährden. Mit Day-One-Unterstützung in SGLang und llama.cpp ist die Einführung kein reines Labor-Demo; sie ist sofort in gängigen Inferenz-Stacks einsatzbereit. Die Wirkung ist besonders sichtbar dort, wo kleine Modelle sofort reagieren müssen: lokale Chats, Coding-Assistenten und agentische Funktionsaufrufe, bei denen DSpark auch die Latenz deutlich reduziert.
Warum funktioniert das jetzt? LLM-Decoding ist oft speichergebunden: Das wiederholte Laden großer Gewichte aus dem DRAM dominiert die Latenz. DSpark begegnet dem mit einem kompakten Draft-Modell, das mehrere Tokens vorschlägt, während das Zielmodell sie in einem Durchgang überprüft – wodurch der Gewichtstraffic amortisiert wird. Das Rezept kombiniert einen DFlash-ähnlichen parallelen Backbone mit einem leichten Markov-Kopf, der Inter-Token-Abhängigkeiten hinzufügt, sowie einen confidence-scheduled Verifier, der unsichere Suffixe abschneidet. Liquid AIs Draft-Modelle haben etwa 300M Parameter und sind auf Akzeptanz statt reinen Verlust trainiert, um pro Durchgang mehr verifizierte Tokens zu liefern. Das Ergebnis: weniger Speicher-Rundtrips pro ausgegebenem Token, was zu höherem Durchsatz führt, ohne die Greedy-Ausgaben zu verändern.
Die Leistung ist nicht in allen Kontexten gleich. Für kleine dichte Modelle (1,2B–2,6B) liefert DSpark konsistente 2–3× Zuwächse auf GPUs und starke On-Device-Beschleunigungen, die die „fühlt sich sofort an“-Schwelle für interaktive Nutzung überschreiten. Das 8B-A1B MoE-Modell zeigt robuste GPU-Zuwächse, aber geringere On-Device-Verbesserungen aufgrund der aktuellen Metal MoE-Effizienz und der Kosten für die Verifizierung mehrerer Tokens über mehrere Experten. Dennoch macht DSparks Fähigkeit, Tokens pro Sekunde auf Laptops zu erhöhen, lokale Assistenten und Agenten deutlich nützlicher, und in agentischen Abläufen berichtet Liquid AI von einer durchschnittlichen Halbierung der Funktionsaufruf-Latenz – ein großer Gewinn für tools-lastige Szenarien, in denen die Antwortzeit der Engpass ist.
Operativ ist DSpark ein Upgrade mit geringem Aufwand: Binden Sie den Draft an das Zielmodell in SGLang an oder verwenden Sie eine DSpark-fähige llama.cpp-Version, und überwachen Sie Akzeptanzrate sowie draft_n/draft_n_accepted zur Validierung des Nutzens. Beginnen Sie mit dem Draft, der zu Ihrem LFM2.5-Ziel passt, und einer moderaten Blockgröße; optimieren Sie für Ihren Domänentext, um die Akzeptanz zu stabilisieren. Da spekulatives Decoding unter Greedy exakt ist, bleiben Ihre Evaluations-Frameworks und Benchmarks vergleichbar. Für den Produktiveinsatz validieren Sie die agentische Performance End-to-End – insbesondere Tool-Latenz und Funktionsaufruf-Frequenz – da DSparks praktischer ROI dort am größten ist, wo mehrstufige Tool-Aufrufe die Antwortzeit dominieren.


