aiexpert
Inicio / Noticias / Nota
Breaking · 07 ago 2026, 11:04 · 4 fuentes

Meta Muse Spark 1.2 + Muse Code lanzamiento: 54 en Índice de Inteligencia, alega 82.9% Terminal-Bench, $0.69/tarea

Meta Superintelligence Labs lanzó Muse Spark 1.2 y Muse Code (beta) el 5 de agosto de 2026. Muse Spark 1.2 es un modelo de razonamiento entrenado explícitamente con Muse Code, agente de terminal de codificación de Meta. Meta alega 82.9% en Terminal-Bench 2.1 y 59% en DeepSWE 1.1. Los evaluadores independientes (Artificial Analysis, Vals) comparan Muse Spark 1.2 en 54 en el Índice de Inteligencia, empatado con Grok 4.5 y 6–7 puntos detrás de modelos fronterizos (Claude Opus 5: 61, Claude Fable 5: 60, GPT-5.6 Sol: 59). Vals reporta $0.69/prueba en Terminal-Bench usando Terminus 2 (arnés común)—el costo más bajo entre sus modelos top-cinco. Precio: $1.25 entrada / $4.25 salida por millón de tokens; nivel Contributor a $0.10/$0.20 para permiso de uso de datos.

Muse Code implementa cuatro tipos de agentes (Coordinador, Explorador, Ejecutor, Verificador) comunicando a través de un registro de eventos compartido que sobrevive a los reinicios sin re-derivar contexto. El agente terminal soporta trabajos de 24–30+ horas (frente a llamadas de API típicas de 10–15 min), agentes de fondo asincrónicos persistentes e aislamiento Git-worktree. El benchmark de codificación interna de Meta muestra Muse Spark 1.2 en 70.6%, detrás de Claude Opus 5 (79.4%) pero por delante de GPT-5.6 Terra (65.4%). Advertencia: el 82.9% proviene del arnés propio de Meta; Terminal-Bench independiente aún no tiene entrada verificada; la afirmación de Muse Spark 1.1 de 80% resultó en 76.2% verificado, una brecha de 3.8 puntos.

Para profesionales evaluando codificación de horizonte largo: la seguridad de reinicio del registro de eventos de Muse Code y agentes asincrónicos paralelos son novedosos para una oferta del lado del modelo abierto. El costo por tarea importa si ejecuta un volumen alto; Vals $0.69 está por debajo de GPT-5.6 y Claude. Meta mostró confianza al publicar gráficos donde Claude Opus 5 gana—inusual para un lanzamiento de proveedor. Observe si la prima de co-training (modelo + arnés) se mantiene en otros marcos; si no, Muse Spark 1.2 solo es tier-2 en razonamiento pero competitivo en precio.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source orcarouter.ai
  2. 02 OrcaRouter: Muse Spark 1.2 analysis orcarouter.ai “Muse Spark 1.2 at 54 on Intelligence Index, $0.69 per test on Vals”
  3. 03 Artificial Analysis artificialanalysis.ai “Intelligence Index 54, GDPval-AA v2 Elo 1631 #5, hallucination 28%”
  4. 04 Kingy.ai: benchmark methodology note kingy.ai “Meta claims 82.9% Terminal-Bench; verified 1.1 at 76.2% (3.8 point gap)”