Meta lanzó Muse Spark 1.2 el 5 de agosto de 2026, una actualización enfocada en codificación enviada junto con Muse Code, el primer agente de codificación de terminal de Meta. En pruebas independientes, Muse Spark 1.2 puntúa 54 en el Índice de Inteligencia de Artificial Analysis en configuración xhigh, colocándolo empatado con Grok 4.5 y apenas detrás de Opus 5 (61), Fable 5 (60) y GPT-5.6 Sol (59)—una ganancia de 3 puntos respecto a Muse Spark 1.1 (51) y 11 puntos del Muse Spark original (43 en abril).
En los propios puntos de referencia internos de Meta, el modelo alcanzó el 82,9% en Terminal-Bench 2.1 (arriba del 76,2% del 1.1) y 59,3% en DeepSWE v1.1. Meta también alegó desempenho de nivel medalla de oro en cinco Olimpíadas STEM: puntuaciones perfectas en la Olimpíada de Física Asiática (APhO) e Olimpíada de Física Internacional (IPhO) en exámenes teóricos, además de medallas de oro en la Olimpíada Matemática Internacional (IMO), Olimpíada de Química Internacional (IChO) y Maestros Romenos de Matemáticas (RMM). Tres competiciones usaron arbitraje oficial en vivo sin herramientas permitidas—solo razonamiento puro a través de orquestación multiagente.
En el índice de precios de Vals, Muse Spark 1.2 ingresó al top 5 a $0,69/prueba, reportedly 3x más barato que Kimi y 10x+ más barato que Fable, Opus y GPT-5.6 Sol. Vals también reportó que se convirtió en el primer modelo por encima del 60% en Finance Agent v2 a $0,77/prueba (versus Opus 5 a $5,12/prueba) mientras ejecutaba 2x la velocidad. Muse Spark 1.2 mantiene precios de API estándar de $1,25 por millón de tokens de entrada y $4,25 por millón de tokens de salida, sin cambios respecto a 1.1. Meta también ofrece un nivel de contribuidor 12,5x más barato en entrada y 21,25x más barato en salida a cambio del consentimiento de datos de entrenamiento.
Para arquitectos, Muse Spark 1.2 señala que el cadence de lanzamiento de cuatro semanas de Meta está superando el ecosistema de evaluación—aún no hay desglose de punto de referencia publicado por prueba para 1.2. Los resultados de las Olimpíadas dependen de orquestación multiagente y rejection sampling, no solo escala de modelo bruto, sugiriendo que el camino hacia el desempeño de frontera cada vez más se ejecuta a través de harnesses y TTC (time-to-completion), no solo pesos de modelo. El delta de precio a rendimiento importa para cargas de trabajo agentic sensibles a costos, especialmente si la configuración de Finance Agent v2 (2x velocidad con 1/7 del costo) se mantiene en producción.