Meta lanzó Muse Glimmer el lunes, un modelo agéntico de peso abierto con 30 mil millones de parámetros diseñado para ejecutarse en GPUs de consumidor y laptops. El modelo está disponible para descarga gratuita en Hugging Face bajo una licencia Apache 2.0 y optimizado para flujos de trabajo locales siempre activos—gestión de cronograma, organización de archivos, tareas de codificación y llamadas de herramientas basadas en agentes sin dependencia de nube. Meta utilizó técnicas de cuantización para comprimir Glimmer a aproximadamente 17 gigabytes, abajo de 55+ gigabytes en precisión completa, haciéndolo compatible con GPU de consumidor que contienen 24–32GB de memoria.
Glimmer fue creado a través de destilación logit del modelo Muse Spark 1.2 más grande de Meta, transferencia de capacidades de razonamiento para tareas agénticas, y agregó una capa de decodificación especulativa ligera (drafter 'DFlash') que predice bloques de 16 tokens. El drafter aumentó velocidad de generación de 74,9 a 233,4 tokens/segundo en un RTX 5090, y de 23,7 a 37,8 en un M4 Max. Meta reporta que Glimmer anotó 77,0 en IFBench (vs. 76,0 de Gemma4-31B) y 94,7 en razonamiento AIME 2026.
El CEO Mark Zuckerberg posicionó el lanzamiento como un desafío a los competidores de código abierto chino (DeepSeek, Alibaba) y pidió cambios de política de EE.UU. sobre el uso de datos y destilación. Para arquitectos construyendo infraestructura de agentes, la capacidad en dispositivo de Glimmer importa: permite flujos de trabajo agénticos privados y de baja latencia sin enviar datos a la nube, y el lanzamiento de peso abierto reduce la barrera para ajuste fino y despliegue de agentes personalizados. El pipeline de destilación (Spark → Glimmer) es ahora un patrón de referencia para convertir modelos frontier en agentes desplegables.