aiexpert
Início / Notícias / Nota
Research · 13 de ago. de 2026, 17:02 · 4 fontes

OpenAI apresenta modo Ultrafast para GPT-5.6 Sol a 750 tokens/seg em hardware Cerebras

A OpenAI revelou o modo Ultrafast para GPT-5.6 Sol, seu modelo mais capaz, executado a até 750 tokens de saída por segundo em hardware wafer-scale Cerebras—aproximadamente 5× os ~150 tokens por segundo típicos de modelos de produção e 10× mais rápido do que implantações padrão de NVIDIA H100. O nível está disponível em visualização limitada hoje através da API OpenAI, com acesso se expandindo conforme a capacidade cresce.

O avanço em velocidade é mais importante para fluxos de trabalho agentic que encadeiam dezenas de chamadas de modelo. Uma operação multi-step que demoraria 8 segundos por step em hardware padrão agora completa em ~2 segundos por step. Para empresas executando milhares de execuções de agente diariamente, isso se compõe em fluxos de trabalho mudando de conclusões multi-minuto para segundos—permitindo resposta a incidentes em tempo real, análise financeira, suporte ao cliente e casos de uso de comércio onde a latência atualmente bloqueia adoção. A OpenAI já está usando Ultrafast internamente para resposta a incidentes e fluxos de trabalho de pesquisa; clientes iniciais incluem Jane Street e empresas nos setores de codificação, comércio e serviços financeiros.

A parceria Cerebras sustenta a realização: OpenAI e Cerebras formalizaram um acordo plurianual em janeiro de 2026 para implantar 750 megawatts de capacidade de inferência de baixa latência dedicada. O desdobramento é estrategicamente cronometrado: Cerebras está se preparando para um IPO em 2026, e conquistar OpenAI como cliente de referência fortalece sua narrativa de crescimento antes das discussões de roadshow.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source openai.com
  2. 02 Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed openai.com
  3. 03 GPT-5.6 Sol Hits 750 Tokens/Sec: Speed Is a Buying Test beam.ai “750 tokens a second on Cerebras hardware, roughly 5x the ~150 tokens a second most production models deliver”
  4. 04 Cerebras Runs OpenAI GPT-5.6 Sol at 750 Tokens per Second valueaddvc.com “roughly 10x faster than any Nvidia GPU deployment of a frontier model in production”