aiexpert
Inicio / Noticias / Nota
Research · 10 ago 2026, 20:04 · 5 fuentes

Meta abre código Muse Glimmer, modelo agentico de 30B que funciona en GPU de consumidor único

Meta Superintelligence Labs lanzó Muse Glimmer el 10 de agosto de 2026 — un modelo agentico de 30 mil millones de parámetros con pesos abiertos licenciado bajo Apache 2.0 y optimizado para ejecutarse completamente en hardware de consumidor (24–32 GB de VRAM). El modelo se destila del modelo de frontera cerrado Muse Spark e incluye capacidades multimodales (texto/imagen), llamada de herramientas y razonamiento de largo horizonte necesarios para agentes locales siempre activos.

Con cuantización de 4 bits, el modelo completo se comprime de 55 GB (precisión total) a menos de 20 GB, dejando espacio para memoria de trabajo y decodificación especulativa. Meta agrupa decodificación especulativa por bloque DFlash, que logra aceleración de generación de tokens de 3.1× en un RTX 5090, 1.8× en un M5 Max y 1.5× en un M4 Max — lo suficientemente rápido para interacción agentica fluida sin llamadas de red. Los pesos están disponibles ahora en Hugging Face; soporte nativo para llama.cpp, ExecuTorch y vLLM lanzándose en los próximos días.

Para arquitectos: esto mueve IA agentica de solo nube a local primero. El modelo de 30B supera a Gemma4-31B y Qwen3.6-27B en benchmarks agenticos (MCP-Atlas 75.5 vs. 54.2 y 62.5; DeepSearch QA 74.6 vs. pares en los 50s). Tiene rendimiento inferior en tareas puras de terminal/uso de computadora pero está diseñado para orquestación de herramientas, codificación y razonamiento. Señala la comoditización de modelos agenticos sub-frontera y respalda la tesis de "superinteligencia personal" de Zuckerberg.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source huggingface.co
  2. 02 huggingface.co huggingface.co “Muse Glimmer is a 30-billion-parameter causal language model with a dedicated perception encoder, distilled from Muse Spark and purpose-built for autonomous agentic tasks on consumer hardware”
  3. 03 opensourceforu.com opensourceforu.com “By applying 4-bit quantization, Meta compressed memory demands from 55 GB to 18–20 GB”
  4. 04 marktechpost.com marktechpost.com “It also leads on DeepSearch QA at 74.6, Gaia2 at 43.3, and SWE-Bench Pro at 51.2”
  5. 05 neowin.net neowin.net “DFlash delivers a 3.1x speedup on an Nvidia RTX 5090, 1.8x on an M5 Max, and 1.5x on an M4 Max”