A OpenAI revelou o modo Ultrafast para GPT-5.6 Sol, seu modelo mais capaz, executado a até 750 tokens de saída por segundo em hardware wafer-scale Cerebras—aproximadamente 5× os ~150 tokens por segundo típicos de modelos de produção e 10× mais rápido do que implantações padrão de NVIDIA H100. O nível está disponível em visualização limitada hoje através da API OpenAI, com acesso se expandindo conforme a capacidade cresce.
O avanço em velocidade é mais importante para fluxos de trabalho agentic que encadeiam dezenas de chamadas de modelo. Uma operação multi-step que demoraria 8 segundos por step em hardware padrão agora completa em ~2 segundos por step. Para empresas executando milhares de execuções de agente diariamente, isso se compõe em fluxos de trabalho mudando de conclusões multi-minuto para segundos—permitindo resposta a incidentes em tempo real, análise financeira, suporte ao cliente e casos de uso de comércio onde a latência atualmente bloqueia adoção. A OpenAI já está usando Ultrafast internamente para resposta a incidentes e fluxos de trabalho de pesquisa; clientes iniciais incluem Jane Street e empresas nos setores de codificação, comércio e serviços financeiros.
A parceria Cerebras sustenta a realização: OpenAI e Cerebras formalizaram um acordo plurianual em janeiro de 2026 para implantar 750 megawatts de capacidade de inferência de baixa latência dedicada. O desdobramento é estrategicamente cronometrado: Cerebras está se preparando para um IPO em 2026, e conquistar OpenAI como cliente de referência fortalece sua narrativa de crescimento antes das discussões de roadshow.