<cite index="64-1">NVIDIA lanzó Magpie TTS Multilingual el 10 de agosto de 2026, proporcionando conversión de texto a voz de código abierto multilingüe para agentes de voz y embajadores de marca</cite>. <cite index="61-1,61-2">El modelo de 364M parámetros sintetiza voz en 12 idiomas—árabe, chino, inglés, francés, alemán, hindi, italiano, japonés, coreano, portugués, español, vietnamita—utilizando arquitectura codificador-decodificador de transformadores con predicción multi-codebook, guía sin clasificador y Optimización de Política Relativa de Grupo</cite>. <cite index="65-2">La versión 2602 añadió soporte para hindi y japonés con capacidades expandidas de code-switching</cite>.
<cite index="65-3,70-2">Magpie soporta tanto inferencia de transmisión como fuera de línea; genera voz al predecir tokens de codec de audio discreto a través del transformador codificador-decodificador, con codec de audio posterior convirtiendo tokens en forma de onda audible</cite>. <cite index="61-3">El modelo se conecta en tuberías de IA existentes para configuraciones de agentes de voz en cascada, donde convierte texto LLM en voz natural y en tiempo real para reproducción del usuario, sin alterar modelos de lenguaje ascendente o manejo de audio descendente</cite>. Esto permite agentes de voz multilingües de baja latencia que los desarrolladores pueden implementar y ajustar en su propia infraestructura.
<cite index="70-2,70-3">La versión NIM (Microservicio de Inferencia NVIDIA) proporciona latencia de producción: Magpie logra salida de voz alemana natural sin reproducción directa necesaria, y puede manejar entradas de formato largo a través de modo de transmisión o inferencia por lotes</cite>. Para practicantes que construyen agentes de voz multilingües, la base de código abierto Magpie + pila NIM de producción elimina el bloqueo a API de voz administradas, permitiendo implementación local con garantías de residencia de datos y previsibilidad de latencia—una superficie de control crítica para constructores de aplicaciones de voz-IA apuntando a ventanas de respuesta de extremo a extremo de menos de 200 ms.