Meta ha abierto el código fuente de Muse Glimmer, un modelo de 30 mil millones de parámetros destilado de su mayor Muse Spark 1.2, diseñado para ejecutar agentes de IA locales en hardware consumidor sin dependencia de nube. Lanzado bajo Apache 2.0 con pesos en Hugging Face, Glimmer cabe en una sola GPU con 24GB VRAM y está optimizado para flujos de trabajo agentic incluyendo function calling, generación de código, manipulación de archivo y captura de pantalla, y planificación de tareas de múltiples pasos. El modelo soporta entrada multimodal (texto + imágenes) y se ejecuta en GPU consumidor (serie RTX), Mac M4/M5 Max, y hardware AMD Ryzen AI.
Glimmer fue entrenado usando un pipeline de tres fases: pre-entrenamiento vía destilación de logit en salidas de Muse Spark; mid-training en datos de contexto extendido, pesados en agentes con rastreo de razonamiento más rico; y post-entrenamiento combinando fine-tuning supervisado con destilación on-policy y aprendizaje por refuerzo. Un modelo drafter secundario ligero basado en DFlash usa decodificación especulativa, proponiendo bloques de 16 tokens para verificación paralela. En NVIDIA RTX 5090, esto aumenta velocidad de generación de 74.9 a 233.4 tokens por segundo; en M4 Max de 23.7 a 37.8 tokens/seg; en M5 Max de 26.6 a 50.2 tokens/seg.
Para equipos de desarrollo y empresas construyendo aplicaciones agentic, Glimmer elimina latencia de nube y costos de API por-token del bucle. Los benchmarks muestran liderazgo en MCP Atlas (75.5) y DeepSearch QA (74.6) versus Gemma4-31B y Qwen3.6-27B, señalizando fuerte razonamiento agentic en el borde. Meta enmarca esto como parte de la visión 'superinteligencia personal' de Zuckerberg—distribuyendo IA capaz a dispositivos individuales en lugar de centralizarla. Para industrias reguladas, flujos de trabajo sensibles a privacidad, e implementaciones restringidas por costos, la inferencia local en pesos abiertos desbloquea nuevos patrones agentic.