OpenAI anunció cortes de precios agresivos para modelos GPT-5.6: Luna cayó 80% a $0,20 por millón de tokens de entrada (de ~$1,20), Terra cayó 20% a $2/$12 precios de entrada/salida, y GPT-5.6 Sol introdujo un nuevo modo 2,5× más rápido a 2× el precio estándar sin degradación de inteligencia. Los cortes están vinculados a mejoras de eficiencia a nivel de sistema en todo el modelo, pila de inferencia y capa de orquestación agentícica, incluyendo optimización de kernel autónoma y ganancias de decodificación especulativa.
La métrica más destacada: GPT-5.4 completo (flagship de marzo de OpenAI) en su pico de benchmark (51 en equivalente Arena Elo) ahora cuesta 13× más que GPT-5.6 Luna al mismo nivel de rendimiento. En apenas cuatro meses, OpenAI ha comprimido la curva de costos a una tasa anualizada de ~2000× manteniendo inteligencia constante. Posteriormente, la auto-revisión de ChatGPT y Codex CLI se están migrando de GPT-5.4 a Luna, resultando en ahorros de ~10× costo por tarea.
Para compradores de infraestructura de IA y equipos de plataforma LLM: este shock de precios señala una descomposición fundamental en lo que 'costo de modelo' significa. La destilación, decodificación especulativa, optimización de inferencia y almacenamiento en caché de indicaciones están impulsando la economía de unidad marginal por debajo de lo que la eficiencia a nivel de sistema predice. A medida que los modelos abiertos (Laguna de Poolside, Inkling de Thinky, DeepSeek) mejoran, la ventaja de propiedad se desplaza de capacidad bruta a orquestación—diseño de orquestación, enrutamiento de herramientas y compactación de contexto que OpenAI puede afinar end-to-end.