aiexpert
Inicio / Noticias / Nota
Research · 25 jul 2026, 11:04 · 4 fuentes

Black Forest Labs FLUX 3: Vídeo + Audio + Acción Multimodal en Un Modelo; Supera Seedance, Runway

Black Forest Labs reveló FLUX 3 el 23 de julio de 2026, un modelo frontier multimodal entrenado conjuntamente en imágenes, video, audio y predicción de acciones dentro de una arquitectura única. FLUX 3 Video genera clips de 20 segundos con audio nativo sincronizado; FLUX 3 Action predice movimientos robóticos; FLUX 3 Image mejora generación de imágenes fijas. El modelo se basa en el enfoque Self-Flow de Black Forest Labs para alinear comprensión y generación multimodal, escalado a miles de millones de parámetros en múltiples modalidades simultáneamente.

En evaluaciones iniciales de preferencia humana, FLUX 3 Video supera Runway Gen-4.5 en 77% de comparaciones y Luma Ray 3.2 en 93%, mientras funciona a paridad con Seedance 2.0 y Gemini Omni (52% de victorias). FLUX 3 es particularmente fuerte en expresiones faciales humanas, renderización de texto multilingüe, y asociación de sonidos con eventos físicos. FLUX-mimic, un derivado de video-acción, ya está siendo probado e implementado en Audi para manipulación robótica de propósito general, aprendiendo nuevas tareas de tan solo 30 minutos de datos robóticos.

El lanzamiento es por fases: FLUX 3 Video y Action están en acceso temprano ahora; FLUX 3 Image se lanza en las próximas semanas; FLUX 3 Dev open-weight es prometido para más tarde en 2026. Sin precios divulgados. Para constructores de sistemas creativos, robótica, y stacks de simulación, la unificación arquitectónica—un modelo para video, imagen, audio, y acción—señala un cambio de ensamblar herramientas específicas de modalidad hacia modelos de mundo unificados. FLUX.1 logró adopción abierta en difusión; la promesa open-weight de FLUX 3 podría acelerar adopción de robótica personalizada y sistemas agentes.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source globenewswire.com
  2. 02 globenewswire.com globenewswire.com “FLUX 3 jointly learns from images, video, and audio within a unified architecture, and can also be extended to predict actions”
  3. 03 venturebeat.com venturebeat.com “FLUX 3 Video already leads in early evaluations against frontier video models, and is particularly strong in capturing human facial expressions, associating sounds with physical events, and multilingual capabilities”
  4. 04 tech.yahoo.com tech.yahoo.com “human reviewers preferred FLUX 3's output over Runway Gen-4.5 in 77% of head-to-head comparisons and over Luma Ray 3.2 in 93%”