SpaceXAI lançou Grok 4.6 em 12 de agosto, posicionado como correspondente ao desempenho Fable 5 com um desconto dramático. No Artificial Analysis Intelligence Index—um benchmark composto—Grok 4.6 publica uma 61, nível com GPT-5.6 Sol Max e um ponto atrás de Fable 5 Max em 62. O modelo é precificado em $2/$6 por milhão de tokens de entrada/saída, 60%+ abaixo de Claude Opus 5 e GPT-5.6 Sol. A afirmação de paridade, porém, é mantida de forma restrita: em contagens de benchmark diretas, Grok 4.6 perde para Fable 5 Max em 7 de 10 testes compartilhados.
Em trabalho agentico de longo horizonte (AA-Briefcase), Grok 4.6 atinge nível Fable 5 com um Elo de 1577 enquanto usa 53 turnos e 500M tokens de entrada em média—metade dos turnos e um quarto dos tokens que Claude Opus 5 (máx.) requer (~103 turnos, ~2B tokens). Essa vantagem de eficiência se compõe no custo por tarefa: Grok 4.6 custa $0.84 por tarefa no mesmo benchmark, colocando-o na fronteira Pareto de eficiência de custos. Em métricas de inteligência pura (GDPVal-AA v2 em 1753), Grok 4.6 lidera tanto Fable 5 Max (1741) quanto Sol (1728).
Para arquitetos de produção e equipes de plataforma, o sinal é econômico: Grok 4.6 troca uma lacuna de inteligência marginal (vence 3/10 vs Fable, 6/9 vs Sol) por TCO dramaticamente menor em cargas de trabalho agenticas e de codificação. A vantagem de custo é maior em tarefas de longo prazo onde a queimadura de token importa mais do que a taxa por token. A janela de contexto permanece em 500K, mas o preço salta no limite de 200K tokens, criando um trade-off em escala.