Meta Superintelligence Labs lanzó Muse Spark 1.2 y Muse Code (beta) el 5 de agosto de 2026. Muse Spark 1.2 es un modelo de razonamiento entrenado explícitamente con Muse Code, agente de terminal de codificación de Meta. Meta alega 82.9% en Terminal-Bench 2.1 y 59% en DeepSWE 1.1. Los evaluadores independientes (Artificial Analysis, Vals) comparan Muse Spark 1.2 en 54 en el Índice de Inteligencia, empatado con Grok 4.5 y 6–7 puntos detrás de modelos fronterizos (Claude Opus 5: 61, Claude Fable 5: 60, GPT-5.6 Sol: 59). Vals reporta $0.69/prueba en Terminal-Bench usando Terminus 2 (arnés común)—el costo más bajo entre sus modelos top-cinco. Precio: $1.25 entrada / $4.25 salida por millón de tokens; nivel Contributor a $0.10/$0.20 para permiso de uso de datos.
Muse Code implementa cuatro tipos de agentes (Coordinador, Explorador, Ejecutor, Verificador) comunicando a través de un registro de eventos compartido que sobrevive a los reinicios sin re-derivar contexto. El agente terminal soporta trabajos de 24–30+ horas (frente a llamadas de API típicas de 10–15 min), agentes de fondo asincrónicos persistentes e aislamiento Git-worktree. El benchmark de codificación interna de Meta muestra Muse Spark 1.2 en 70.6%, detrás de Claude Opus 5 (79.4%) pero por delante de GPT-5.6 Terra (65.4%). Advertencia: el 82.9% proviene del arnés propio de Meta; Terminal-Bench independiente aún no tiene entrada verificada; la afirmación de Muse Spark 1.1 de 80% resultó en 76.2% verificado, una brecha de 3.8 puntos.
Para profesionales evaluando codificación de horizonte largo: la seguridad de reinicio del registro de eventos de Muse Code y agentes asincrónicos paralelos son novedosos para una oferta del lado del modelo abierto. El costo por tarea importa si ejecuta un volumen alto; Vals $0.69 está por debajo de GPT-5.6 y Claude. Meta mostró confianza al publicar gráficos donde Claude Opus 5 gana—inusual para un lanzamiento de proveedor. Observe si la prima de co-training (modelo + arnés) se mantiene en otros marcos; si no, Muse Spark 1.2 solo es tier-2 en razonamiento pero competitivo en precio.