Liquid AI lanzó LFM2.5-2.6B el 4 de agosto de 2026, un modelo de 2.6 mil millones de parámetros diseñado para cargas de trabajo agentes en dispositivo sin dependencia en la nube. El modelo se ejecuta a 220 tokens/segundo en Apple M5 Max, 113 tok/s en AMD Ryzen CPU y hasta 30 tok/s en teléfonos, todo dentro de 2.5 GB de memoria. Fue pre-entrenado en ~34 billones de tokens con una ventana de contexto de 128K y post-entrenado en cuatro etapas: ajuste supervisionado, especialización de expertos, destilación on-policy multidomain y aprendizaje por refuerzo agéntico dentro de arneses activos (OpenClaw, Hermes Agent).
LFM2.5-2.6B es competitivo con modelos 4-10x más grandes en uso de herramientas, seguimiento de instrucciones y tareas agénticas multietapa. En benchmarks de uso de herramientas (BFCLv4, ToolSandbox, Claw-Eval), iguala o supera modelos Gemma 5-8B y Qwen 4.7-9.7B. La arquitectura utiliza principalmente convoluciones cortas con capas de atención selectiva (convoluciones LIV), que mantienen estado de tamaño constante por token y eliminan sobrecarga de caché KV—una ventaja de eficiencia clave sobre transformadores densos. La inferencia de GPU alcanza 15K tokens de salida/segundo en una sola H100 con alta concurrencia.
Para arquitectos que envían agentes: los modelos agentes en dispositivo eliminan costos por token e habilitan inferencia con privacidad de forma predeterminada. El entrenamiento de LFM2.5-2.6B dentro de arneses reales (no trazas sintéticas) debe mejorar la compatibilidad real del uso de herramientas. Los 30 tok/s en teléfonos abren casos de uso de robótica e IA integrada. El giro del modelo de costos—de restricción de gasto de tokens a restricción de rendimiento local—permite agentes de fondo continuo. El énfasis de Liquid en arquitecturas basadas en convolución en lugar de pura atención puede señalar hacia dónde van los modelos de borde eficientes.