SpaceXAI envió Grok 4.6 el 12 de agosto, posicionado como equivalente al desempeño Fable 5 con un descuento dramático. En el Artificial Analysis Intelligence Index—un benchmark compuesto—Grok 4.6 publica un 61, nivel con GPT-5.6 Sol Max y un punto por debajo de Fable 5 Max en 62. El modelo tiene un precio de $2/$6 por millón de tokens de entrada/salida, 60%+ por debajo de Claude Opus 5 y GPT-5.6 Sol. La afirmación de paridad, sin embargo, se mantiene estrechamente: en conteos de benchmark directo, Grok 4.6 pierde contra Fable 5 Max en 7 de 10 pruebas compartidas.
En trabajo agentico de largo horizonte (AA-Briefcase), Grok 4.6 logra nivel Fable 5 con un Elo de 1577 mientras usa 53 turnos y 500M tokens de entrada en promedio—la mitad de los turnos y una cuarta parte de los tokens que Claude Opus 5 (máx.) requiere (~103 turnos, ~2B tokens). Esta ventaja de eficiencia se compone en costo por tarea: Grok 4.6 cuesta $0.84 por tarea en el mismo benchmark, colocándolo en la frontera Pareto de eficiencia de costos. En métricas de inteligencia pura (GDPVal-AA v2 en 1753), Grok 4.6 lidera tanto a Fable 5 Max (1741) como a Sol (1728).
Para arquitectos de producción y equipos de plataforma, la señal es económica: Grok 4.6 intercambia una brecha de inteligencia marginal (gana 3/10 vs Fable, 6/9 vs Sol) por TCO dramáticamente menor en cargas de trabajo agenticas y de codificación. La ventaja de costo es mayor en tareas de larga duración donde la quema de tokens importa más que la tasa por token. La ventana de contexto se mantiene en 500K, pero el precio salta en el límite de 200K tokens, creando un trade-off a escala.