Liquid AI envió puntos de control de borrador DSpark para tres modelos LFM2.5 el 20 de agosto: los modelos 1.2B-Instruct, 2.6B y 8B-A1B. La técnica de decodificación especulativa alcanza 3.18x de rendimiento en H100 y 2.87x en M4 Max, sin degradación de la calidad de salida.

La decodificación especulativa ejecuta un pequeño modelo de borrador que propone tokens candidatos, luego permite que el modelo objetivo verifique todo el lote en una única pasada directa. DSpark añade tres componentes: una red troncal paralela que genera estados ocultos para todos los tokens de borrador en una única pasada, una cabeza de Markov que modela dependencias entre tokens para aumentar las tasas de aceptación, y un verificador de confianza programada que elimina sufijos de baja confianza antes de que la sobrecarga de verificación supere la ganancia de aceleración.

Cada modelo de borrador tiene aproximadamente 300M parámetros: 295.7M para el 1.2B, 327.7M para el 2.6B y 8B-A1B. El entrenamiento se ejecutó 15 épocas con datos SFT, chat, código y de llamadas de función. El punto de control de lanzamiento fue seleccionado por la tasa de aceptación más alta, no la pérdida más baja.

En H100, el 8B-A1B muestra las ganancias más fuertes: MATH500 alcanza 3.18x (428 → 1362 tok/s, aceptación 8.27/10), MT-Bench alcanza 3.02x (426 → 1288 tok/s), y el promedio de cinco puntos de referencia es 2.54x (418 → 1074 tok/s). El 2.6B promedia 2.67x en H100 (323 → 864 tok/s). El 1.2B promedia 2.10x (656 → 1384 tok/s absoluto). La latencia de llamada de función disminuye 57% en el 2.6B en escenarios multi-herramienta. La salida es idéntica a la decodificación voraz sin asistencia por construcción: los tokens de borrador rechazados se reemplazan por el token propio del modelo objetivo.

Los resultados en dispositivo son mixtos. El 2.6B en M4 Max alcanza 2.27x (61 → 139 tok/s), igualando o superando la mayoría de las API de nube propietarias en el borde. El 1.2B en M4 Max promedia 2.54x (138 → 350 tok/s promedio en cinco puntos de referencia; MATH500 específicamente alcanza 140 → 366 tok/s, HumanEval 136 → 389 tok/s). El 8B-A1B, sin embargo, promedia solo 1.18x en M4 Max (90 → 106 tok/s) versus 2.54x en H100. La brecha se debe a la implementación de MoE del backend Metal de llama.cpp: verificar un bloque de token activa más expertos por paso, generando más tráfico de peso que la línea base y erosionando la ganancia de decodificación especulativa.

La aceptación de GSM8K para el 8B-A1B cae a 4.02/10—la más baja en todas las combinaciones—produciendo aceleración de 1.29x (385 → 496 tok/s) en lugar de 3.18x. La tasa de aceptación es la palanca primaria: la sobrecarga del modelo de borrador cancela los ahorros cuando los tokens se rechazan. Los equipos que evalúan DSpark deben perfilar las tasas de aceptación en sus datos específicos antes de comprometerse.

DSpark ofrece ganancias H100 sustanciales en los tres tamaños sin regresión de precisión, pero MoE en Apple Silicon sigue siendo problemático. Difiera 8B-A1B en dispositivo hasta que la ruta de MoE de Metal de llama.cpp madure.