OpenAI reduziu drasticamente os preços de dois modelos na sua lineup GPT-5.6 em 30 de julho, cortando Luna—o tier mais pequeno e rápido—em 80% para $0.20/$1.20 por milhão de tokens de entrada/saída, e Terra em 20% para $2/$12, deixando o flagship Sol inalterado. Os cortes chegaram apenas três semanas após o lançamento da família GPT-5.6 e refletem ganhos de eficiência em todo o sistema: o GPT-5.6 Sol reescreveu autonomamente seus próprios kernels de GPU de produção e modelos de decodificação especulativa, reduzindo custos de serving em 20–15% através de auto-otimização.
Luna agora oferece custo ~87% menor que o GPT-5.4 mini pela mesma capacidade de raciocínio—uma redução de 13x em quatro meses—e fica abaixo do Gemini 3.6 Flash do Google ($1.50/$7.50). O movimento undercuta rivais chineses DeepSeek V4 Pro em custos de entrada e visa compradores empresariais que haviam mudado para modelos mais baratos. O Claude Opus 5 do Anthropic em $5/$25 permanece mais capaz, mas mais caro; Google, Microsoft e Anthropic todos cortaram preços semanas antes, disparando a corrida.
Arquitetos devem notar a estratégia de tier duplo: Luna commoditiza inferência para workflows de alto volume (agentes, classificação, sumarização), enquanto um novo modo Sol Fast cobra 2× o preço padrão para até 2.5× throughput sem mudança de inteligência—monetizando latência separadamente. OpenAI sinalizou que isto é estrutural, não temporário: CEO Sam Altman disse que custos eram "uma questão enorme" e a empresa passaria ganhos de eficiência aos usuários. Para sistemas em produção, a base de custo de Luna agora rivaliza modelos open-weight mantendo raciocínio de nível frontier em benchmarks comuns.