O VibeVoice da Microsoft — um modelo speech-to-text no estilo Whisper com diarização de alto-falantes embutida diretamente na arquitetura — está recebendo atenção renovada após o desenvolvedor Simon Willison publicar benchmarks práticos executando a versão quantizada em 4-bit MLX (5,71 GB) em um MacBook Pro M5 Max com 128 GB. O modelo transcreveu uma hora de áudio de podcast em 8 minutos e 45 segundos, atingindo pico de ~61,5 GB de RAM durante a fase de prefill e caindo para ~18 GB durante a geração. O modelo é licenciado sob MIT e o checkpoint mlx-community/VibeVoice-ASR-4bit convertido pela comunidade está disponível no Hugging Face.
Ao contrário do Whisper, o VibeVoice produz JSON estruturado com campos speaker_id por segmento, timestamps e duração — permitindo diarização downstream sem uma etapa de pipeline separada. Willison notou que o modelo distinguiu corretamente dois participantes da conversa mais uma voz distinta de "sponsor read", apresentando três speaker IDs para um podcast de duas pessoas. Um limite rígido de 1 hora de áudio por chamada de inferência significa que gravações mais longas devem ser divididas com janelas sobrepostas e speaker IDs reconciliados entre segmentos. O modelo original (17,3 GB, fp16) foi lançado pela Microsoft em 21 de janeiro de 2026; o artigo de Willison é o primeiro perfil detalhado de desempenho em Apple Silicon a ganhar circulação ampla.