Liquid AI está lanzando puntos de control preliminares DSpark para LFM2.5-1.2B-Instruct, 2.6B y 8B-A1B que añaden decodificación especulativa al camino de decodificación. La afirmación es clara: hasta 3.18× más rendimiento en una sola H100 y hasta 2.87× en dispositivo, manteniendo las salidas codiciosas idénticas a la línea base. Esa paridad es importante—DSpark verifica cada token propuesto—por lo que los equipos pueden adoptar la aceleración sin comprometer las bases de evaluación establecidas. Con soporte desde el primer día en SGLang y llama.cpp, el despliegue no es solo una demostración de laboratorio; es inmediatamente ejecutable en pilas comunes de inferencia. El impacto es más visible donde los modelos pequeños deben sentirse instantáneos: chat local, asistentes de codificación y llamadas a funciones agenticas, donde DSpark también reduce la latencia de forma significativa.
¿Por qué funciona esto ahora? La decodificación de LLM suele estar limitada por la memoria: extraer repetidamente grandes pesos de la DRAM domina la latencia. DSpark aborda esto usando un borrador compacto que propone múltiples tokens, y luego el modelo objetivo los verifica en una sola pasada—amortizando el tráfico de pesos. Su receta combina una columna vertebral paralela estilo DFlash con una cabeza Markov ligera para añadir dependencia entre tokens, y un verificador con programación de confianza que poda sufijos de baja confianza. Los borradores de Liquid AI tienen ~300M de parámetros y están entrenados para aceptación más que para pérdida pura, impulsando más tokens verificados por pasada. El resultado: menos viajes de ida y vuelta por la memoria por token emitido, lo que se traduce en mayor rendimiento sin cambiar las salidas codiciosas.
El rendimiento no es uniforme en todos los contextos. Para modelos densos pequeños (1.2B–2.6B), DSpark ofrece ganancias consistentes de 2–3× en GPUs y fuertes aceleraciones en dispositivos que superan el umbral de “sensación instantánea” para uso interactivo. El modelo MoE 8B-A1B muestra ganancias robustas en GPU pero mejoras menores en dispositivo debido a la eficiencia actual de Metal MoE y el costo de verificar múltiples tokens a través de más expertos. Aun así, la capacidad de DSpark para aumentar tokens por segundo en laptops hace que asistentes y agentes locales sean significativamente más útiles, y en flujos agenticos Liquid AI reporta una reducción promedio de más de la mitad en la latencia de llamadas a funciones—una gran victoria para escenarios con muchas herramientas donde el tiempo de respuesta es el cuello de botella.
Operativamente, DSpark es una actualización de baja fricción: conecta el borrador al modelo objetivo en SGLang o usa una versión de llama.cpp habilitada para DSpark, luego monitorea la tasa de aceptación y draft_n/draft_n_accepted para validar el beneficio. Comienza con el borrador que coincida con tu objetivo LFM2.5 y un tamaño de bloque moderado; ajusta para tu texto de dominio para estabilizar la aceptación. Debido a que la decodificación especulativa es exacta bajo greedy, tus herramientas y benchmarks de evaluación permanecen comparables. Para producción, valida el rendimiento agentico de extremo a extremo—especialmente la latencia de herramientas y la cadencia de llamadas a funciones—ya que el ROI práctico de DSpark parece mayor donde las llamadas a herramientas multi-paso dominan el tiempo de respuesta.


