aiexpert
Início / Notícias / Nota
Breaking · 08 de jul. de 2026, 18:06 · 2 fontes

OpenAI lança modelos de voz GPT-Live com streaming full-duplex e delegação ao vivo

OpenAI anunciou GPT‑Live, uma nova geração de modelos de voz construídos em arquitetura full-duplex que habilita escuta e fala simultânea. Ao contrário de abordagens em cascata anteriores (transcrever→gerar→sintetizar) ou modelos baseados em turnos que esperam silêncio, GPT‑Live toma decisões de interação muitas vezes por segundo: se falar, pausar, continuar ouvindo ou invocar ferramentas. O modelo pode produzir sinais de backchannel ('mhmm', 'yeah') e se envolver em fluxo conversacional natural em vez de trocas rígidas de back-and-forth.

GPT‑Live inclui mecanismo de delegação para tarefas complexas: quando uma pergunta requer busca na web, raciocínio mais profundo ou trabalho agentico, GPT‑Live delega para modelos de fronteira (inicialmente GPT‑5.5 Instant) enquanto mantém o fluxo de conversação. Esse desacoplamento permite que a camada de interação de voz permaneça responsiva enquanto modelos de background lidam com tarefas computacionalmente intensivas. Duas versões lançadas: GPT‑Live‑1 e GPT‑Live‑1 mini. OpenAI planeja trazê-los para a API em breve para desenvolvedores e empresas. Os modelos estão sendo implantados em ChatGPT Voice globalmente.

Avaliações humanas mostram que GPT‑Live‑1 é fortemente preferido sobre ChatGPT Advanced Voice Mode em agradabilidade conversacional, tom-taking, manejo de interrupção e naturalidade. Em GPQA (raciocínio científicio em nível de especialista), GPT‑Live‑1 supera substancialmente Advanced Voice Mode. Em BrowseComp (busca na web agentica), GPT‑Live‑1 mostra ganhos fortes. A mudança aborda limitações arquiteturais de gerações anteriores: modelos em cascata perderam informação entre handoffs e se sentiram lentos; modelos baseados em turnos exigiam detecção de silêncio e se sentiam rígidos.

Para arquitetos construindo agentes nativos de voz e sistemas multimodais, GPT‑Live sinaliza mudança de OpenAI em direção a interações de voz contínuas e com estado que podem manter contexto entre múltiplas tarefas background assíncronas. O padrão full-duplex + delegação é arquitetonicamente significativo: separa a camada de interação (voz baixa-latência) da camada de raciocínio (modelos e ferramentas latência mais alta), habilitando responsividade em tempo real mesmo quando o backend está ocupado. Esse design espelha padrões agenticos onde agentes precisam mostrar atividade ('pensando em voz alta') enquanto executam ferramentas em paralelo.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source openai.com
  2. 02 Introducing GPT‑Live openai.com “GPT-Live is built on a full-duplex architecture, meaning it can listen and speak at the same time. During conversations, GPT‑Live can show it's paying attention with phrases like 'mhmm' or 'yeah', engage in quick back-and-forth, or just stay quiet when you need a moment to think.”