aiexpert
Início / Notícias / Nota
Research · 25 de jul. de 2026, 11:04 · 4 fontes

Black Forest Labs FLUX 3: Vídeo + Áudio + Ação Multimídia em Um Modelo; Bate Seedance, Runway

Black Forest Labs desvendou FLUX 3 em 23 de julho de 2026, um modelo frontier multimídia treinado conjuntamente em imagens, vídeo, áudio e predição de ação dentro de uma arquitetura única. FLUX 3 Vídeo gera clipes de 20 segundos com áudio nativo sincronizado; FLUX 3 Ação prediz movimentos robóticos; FLUX 3 Imagem melhora geração de imagens estáticas. O modelo se baseia na abordagem Self-Flow da Black Forest Labs para alinhar compreensão e geração multimídia, escalada para bilhões de parâmetros em múltiplas modalidades simultaneamente.

Em avaliações iniciais de preferência humana, FLUX 3 Vídeo bate Runway Gen-4.5 em 77% de comparações e Luma Ray 3.2 em 93%, enquanto funciona em paridade com Seedance 2.0 e Gemini Omni (52% de vitórias). FLUX 3 é particularmente forte em expressões faciais humanas, renderização de texto multilingué, e associação de sons com eventos físicos. FLUX-mimic, um derivado de vídeo-ação, já está passando por testes e implantação na Audi para manipulação robótica de propósito geral, aprendendo novas tarefas a partir de apenas 30 minutos de dados robóticos.

O lançamento é em fases: FLUX 3 Vídeo e Ação estão em acesso antecipado agora; FLUX 3 Imagem sai nas próximas semanas; FLUX 3 Dev open-weight é promitido para mais tarde em 2026. Nenhum preço foi divulgado. Para construtores de sistemas criativos, robótica, e stacks de simulação, a unificação arquitetônica—um modelo para vídeo, imagem, áudio, e ação—sinaliza uma mudança de montar ferramentas específicas de modalidade para modelos de mundo unificados. FLUX.1 alcançou adoção aberta em difusão; a promessa de open-weight do FLUX 3 poderia acelerar adoção de robótica customizada e sistemas agentes.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source globenewswire.com
  2. 02 globenewswire.com globenewswire.com “FLUX 3 jointly learns from images, video, and audio within a unified architecture, and can also be extended to predict actions”
  3. 03 venturebeat.com venturebeat.com “FLUX 3 Video already leads in early evaluations against frontier video models, and is particularly strong in capturing human facial expressions, associating sounds with physical events, and multilingual capabilities”
  4. 04 tech.yahoo.com tech.yahoo.com “human reviewers preferred FLUX 3's output over Runway Gen-4.5 in 77% of head-to-head comparisons and over Luma Ray 3.2 in 93%”