aiexpert
Inicio / Noticias / Nota
Research · 13 ago 2026, 17:02 · 4 fuentes

OpenAI presenta modo Ultrafast para GPT-5.6 Sol a 750 tokens/seg en hardware Cerebras

OpenAI ha revelado el modo Ultrafast para GPT-5.6 Sol, su modelo más capaz, ejecutándose a hasta 750 tokens de salida por segundo en hardware wafer-scale Cerebras—aproximadamente 5× los ~150 tokens por segundo típicos de modelos de producción y 10× más rápido que los despliegues estándar de NVIDIA H100. El nivel está disponible en vista previa limitada hoy a través de la API de OpenAI, con acceso expandiéndose conforme crece la capacidad.

El avance de velocidad importa más para flujos de trabajo agentic que encadenan docenas de llamadas de modelo. Una operación multi-paso que tomaría 8 segundos por paso en hardware estándar ahora se completa en ~2 segundos por paso. Para empresas ejecutando miles de ejecuciones de agente diariamente, esto se compone en flujos de trabajo cambiando de completaciones multi-minuto a segundos—permitiendo respuesta a incidentes en tiempo real, análisis financiero, soporte al cliente y casos de uso de comercio donde la latencia actualmente bloquea la adopción. OpenAI ya está usando Ultrafast internamente para respuesta a incidentes y flujos de trabajo de investigación; los clientes iniciales incluyen Jane Street y empresas en sectores de codificación, comercio y servicios financieros.

La asociación Cerebras sustenta el logro: OpenAI y Cerebras formalizaron un acuerdo plurianual en enero de 2026 para desplegar 750 megawatts de capacidad de inferencia de baja latencia dedicada. El despliegue es estratégicamente cronometrado: Cerebras se está preparando para un IPO en 2026, y contar a OpenAI como cliente de referencia fortalece su narrativa de crecimiento antes de las discusiones de roadshow.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source openai.com
  2. 02 Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed openai.com
  3. 03 GPT-5.6 Sol Hits 750 Tokens/Sec: Speed Is a Buying Test beam.ai “750 tokens a second on Cerebras hardware, roughly 5x the ~150 tokens a second most production models deliver”
  4. 04 Cerebras Runs OpenAI GPT-5.6 Sol at 750 Tokens per Second valueaddvc.com “roughly 10x faster than any Nvidia GPU deployment of a frontier model in production”