aiexpert
Início / Notícias / Nota
Chips · 10 de ago. de 2026, 16:35 · 4 fontes

NVIDIA lança Magpie TTS Multilingual com suporte para 12 idiomas, pesos abertos para agentes de voz local

<cite index="64-1">NVIDIA lançou Magpie TTS Multilingual em 10 de agosto de 2026, fornecendo conversão de texto para fala de código aberto multilingue para agentes de voz e embaixadores de marca</cite>. <cite index="61-1,61-2">O modelo de 364M parâmetros sintetiza fala em 12 idiomas—árabe, chinês, inglés, francês, alemão, hindi, italiano, japonês, coreano, português, espanhol, vietnamita—usando arquitetura codificador-decodificador de transformadores com predição multi-codebook, orientação sem classificador e Otimização de Política Relativa de Grupo</cite>. <cite index="65-2">A versão 2602 adicionou suporte para hindi e japonês com capacidades expandidas de code-switching</cite>.

<cite index="65-3,70-2">Magpie suporta tanto inferência em streaming quanto offline; gera fala ao prever tokens de codec de áudio discreto via transformador codificador-decodificador, com codec de áudio subsequente convertendo tokens em forma de onda audível</cite>. <cite index="61-3">O modelo se conecta em pipelines de IA existentes para configurações de agentes de voz em cascata, onde converte texto de LLM em fala natural e em tempo real para reprodução do usuário, sem alterar modelos de idioma upstream ou manipulação de áudio downstream</cite>. Isso permite agentes de voz multilíngues de baixa latência que os desenvolvedores podem implantar e ajustar em sua própria infraestrutura.

<cite index="70-2,70-3">A versão NIM (NVIDIA Inference Microservice) fornece latência de produção: Magpie alcana saída de voz alemã natural sem reprodução direta necessária, e pode lidar com entradas de formato longo via modo de streaming ou inferência em lote</cite>. Para praticantes criando agentes de voz multilíngues, a fundação de código aberto Magpie + stack NIM de produção elimina bloqueio para APIs de fala gerenciadas, permitindo implantação local com garantias de residência de dados e previsibilidade de latência—uma superfîcie de controle crítica para construtores de aplicações de voz-IA visando janelas de resposta de ponta a ponta de menos de 200 ms.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source huggingface.co
  2. 02 huggingface.co huggingface.co “Magpie TTS Multilingual open-weights model; 364M parameters; supports 12 languages including new Arabic, Korean, Portuguese”
  3. 03 huggingface.co huggingface.co “B200 achieves 32ms time-to-first-audio (TTFA); 239ms TTFA at 64 concurrent streams with 320× real-time throughput”
  4. 04 huggingface.co huggingface.co “Cascaded architecture: deployed on-prem via NIM; frame stacking + local transformer optimize real-time latency”