aiexpert
Inicio / Noticias / Nota
Chips · 10 ago 2026, 16:35 · 4 fuentes

NVIDIA lanza Magpie TTS Multilingual con soporte de 12 idiomas, pesos abiertos para agentes de voz local

<cite index="64-1">NVIDIA lanzó Magpie TTS Multilingual el 10 de agosto de 2026, proporcionando conversión de texto a voz de código abierto multilingüe para agentes de voz y embajadores de marca</cite>. <cite index="61-1,61-2">El modelo de 364M parámetros sintetiza voz en 12 idiomas—árabe, chino, inglés, francés, alemán, hindi, italiano, japonés, coreano, portugués, español, vietnamita—utilizando arquitectura codificador-decodificador de transformadores con predicción multi-codebook, guía sin clasificador y Optimización de Política Relativa de Grupo</cite>. <cite index="65-2">La versión 2602 añadió soporte para hindi y japonés con capacidades expandidas de code-switching</cite>.

<cite index="65-3,70-2">Magpie soporta tanto inferencia de transmisión como fuera de línea; genera voz al predecir tokens de codec de audio discreto a través del transformador codificador-decodificador, con codec de audio posterior convirtiendo tokens en forma de onda audible</cite>. <cite index="61-3">El modelo se conecta en tuberías de IA existentes para configuraciones de agentes de voz en cascada, donde convierte texto LLM en voz natural y en tiempo real para reproducción del usuario, sin alterar modelos de lenguaje ascendente o manejo de audio descendente</cite>. Esto permite agentes de voz multilingües de baja latencia que los desarrolladores pueden implementar y ajustar en su propia infraestructura.

<cite index="70-2,70-3">La versión NIM (Microservicio de Inferencia NVIDIA) proporciona latencia de producción: Magpie logra salida de voz alemana natural sin reproducción directa necesaria, y puede manejar entradas de formato largo a través de modo de transmisión o inferencia por lotes</cite>. Para practicantes que construyen agentes de voz multilingües, la base de código abierto Magpie + pila NIM de producción elimina el bloqueo a API de voz administradas, permitiendo implementación local con garantías de residencia de datos y previsibilidad de latencia—una superficie de control crítica para constructores de aplicaciones de voz-IA apuntando a ventanas de respuesta de extremo a extremo de menos de 200 ms.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source huggingface.co
  2. 02 huggingface.co huggingface.co “Magpie TTS Multilingual open-weights model; 364M parameters; supports 12 languages including new Arabic, Korean, Portuguese”
  3. 03 huggingface.co huggingface.co “B200 achieves 32ms time-to-first-audio (TTFA); 239ms TTFA at 64 concurrent streams with 320× real-time throughput”
  4. 04 huggingface.co huggingface.co “Cascaded architecture: deployed on-prem via NIM; frame stacking + local transformer optimize real-time latency”