aiexpert
Inicio / Noticias / Nota
Research · 14 ago 2026, 16:06 · 4 fuentes

Meta abre código de Muse Glimmer: modelo agentico 30B optimizado para GPU local; cuantización 4-bit, decodificación especulativa 3.1x

Meta AI Research ha lanzado Muse Glimmer, un modelo agentico de 30B de peso abierto bajo licencia Apache 2.0, optimizado para ejecución local en dispositivo. El modelo destila capacidades de razonamiento del flagship más grande Muse Spark de Meta a través de destilación logit, entrenamiento mid en secuencias de contexto largo con trayectorias de llamadas de herramienta, y alineamiento post-entrenamiento mediante SFT, destilación en política, y RL. Un codificador de percepción dedicado de 1.8B procesa entradas multimodales nativamente (capturas de pantalla, diagramas, documentación), habilitando interpretación de agente inline sin llamadas de API. Muse Glimmer ejecuta agentes autónomos, invocación compleja de herramientas, codificación local, y flujos LLM-como-juez directamente en GPUs/workstations consumidor.

La eficiencia de memoria es central en el diseño. Cuantización dinámica de 4 bits (K-Quant) reduce el footprint del modelo de los típicos 55GB+ a 17–20 GB, cabiendo cómodamente dentro de envelopes de GPU/NPU de 24–32 GB en hardware M4/M5 Max y RTX 5090/4090. DFlash Speculative Decoding empareja el modelo base con un drafter ligero que propone bloques multi-token validados en paralelo, generando ganancias de throughput de generación de hasta 3.1x. El modelo maneja recuperación de fallo: cuando llamadas de API o comandos generan error, diagnostica e intenta caminos alternativos en lugar de detenerse. Compatible con llama.cpp, ExecuTorch, Apple MLX, Ollama, LM Studio, vLLM, y PyTorch/TorchTitan para fine-tuning.

Para arquitectos: el timing y alcance señalan el compromiso de Meta con cargas de trabajo agenticas de primero-local. Muse Glimmer se dirige al nivel GPU consumidor/prosumer de ~$2k–3k (no clusters H100 de alto rango), posicionando agentes locales como alternativas de preservación de privacidad a APIs en nube. Benchmarks de éxito (SWE-Bench, DeepSearch QA, MCP-Atlas) muestran confiabilidad de herramientas multi-paso competitiva o superior vs. Gemma 4 31B y Qwen 3.6 27B. Este es un juego de infraestructura: al abrir el código y optimizar para hardware consumidor, Meta reduce fricción para despliegues de borde, frameworks agenticos, y orgs sensibles a residencia de datos. La ganancia de 3.1x de decodificación especulativa reduce la brécha de latencia vs. endpoints en nube, crucial para agentes interactivos.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source infoq.com
  2. 02 infoq.com infoq.com “Meta AI Research has announced Muse Glimmer, a 30-billion-parameter open-weight model released under the Apache 2.0 license. Engineered specifically for always-on local workflows, Muse Glimmer enables developers to run autonomous agents, complex tool invocation, local coding, and LLM-as-a-judge evaluations directly on consumer GPUs and workstations without depending on cloud APIs.”
  3. 03 infoq.com infoq.com “Dynamic Quantisation: Utilising 4-bit dynamic compression (K-Quant), the model footprint drops to roughly 17 GB to 20 GB. This leaves adequate memory headroom within standard 24 GB to 32 GB GPU/NPU envelopes for the Key-Value (KV) cache, perception embeddings, and speculative decoding overhead. DFlash Speculative Decoding: Rather than predicting one token at a time, Muse Glimmer pairs with a lightweight companion 'drafter' model based on the DFlash architecture. The drafter proposes multi-token blocks that the base model validates in parallel, yielding up to a 3.1x increase in generation throughput on hardware like Apple Silicon (M4/M5 Max) and NVIDIA RTX 5090 cards.”
  4. 04 infoq.com infoq.com “Muse Glimmer is trained to execute long-horizon plans and handle unexpected failure states. When an API call or terminal command returns an error, the model diagnoses the failure and attempts alternative paths rather than terminating execution. It supports agent frameworks like OpenClaw and features adjustable reasoning effort, allowing developers to balance execution speed against decision quality.”