OpenAI anunciou cortes de preços agressivos para modelos GPT-5.6: Luna caiu 80% para $0,20 por milhão de tokens de entrada (de ~$1,20), Terra caiu 20% para $2/$12 preços de entrada/saída, e GPT-5.6 Sol introduziu um novo modo 2,5× mais rápido a 2× o preço padrão sem degradação de inteligência. Os cortes são vinculados a melhorias de eficiência em nível de sistema em todo o modelo, stack de inferência e camada de orquestração agentíjca, incluindo otimização de kernel autônoma e ganhos de decodificação especulativa.
A métrica mais marcante: GPT-5.4 completo (flagship de março da OpenAI) em seu pico de benchmark (51 em equivalente Arena Elo) agora custa 13× mais que GPT-5.6 Luna no mesmo nível de desempenho. Em apenas quatro meses, OpenAI comprimiu a curva de custo a uma taxa anualizada de ~2000× mantendo inteligência constante. Subsequentemente, auto-revisora de ChatGPT e Codex CLI estão migrando de GPT-5.4 para Luna, resultando em economias de ~10× custo por tarefa.
Para compradores de infraestrutura de IA e equipes de plataforma LLM: este choque de preços sinaliza uma decomposição fundamental no que 'custo de modelo' significa. Destilação, decodificação especulativa, otimização de inferência e prompt caching estão impulsionando a economia de unidade marginal abaixo do que apenas eficiência em nível de sistema prediz. Conforme modelos abertos (Laguna de Poolside, Inkling de Thinky, DeepSeek) melhoram, a vantagem proprietária muda de capacidade bruta para orquestração—design de orquestração, roteamento de ferramentas e compactação de contexto que OpenAI pode afinar end-to-end.