Black Forest Labs reveló FLUX 3 el 23 de julio, un modelo de frontera multimodal entrenado conjuntamente en imágenes, vídeo, audio y predicción de acciones dentro de una única arquitectura unificada construida en el enfoque Self-Flow de la empresa. FLUX 3 Video genera clips de hasta 20 segundos con audio nativo y sincronizado a partir de indicaciones de texto, imágenes o referencias de vídeo; soporta continuación de vídeo, transiciones de fotogramas clave, diálogos multilingües y encadenamiento de múltiples clips. En evaluaciones internas iniciales, BFL afirma que FLUX 3 Video supera Runway Gen-4.5 en 77% de comparaciones frente a frente y Luma Ray 3.2 en 93%, aunque son puntos de referencia preliminares y auto-reportados con metodología completa a seguir en disponibilidad más amplia.
La idea clave de la arquitectura es que la generación de vídeo y la predicción de acciones no requieren fundamentos separados—las mismas representaciones aprendidas de estructura espacial, dinámica temporal y causalidad sirven a ambas. Junto a FLUX 3 Video, BFL y el socio de robótica mimic anunciaron FLUX-mimic, un modelo video-acción en implementación temprana con Audi. FLUX-mimic puede ajustar nuevas tareas de manipulación robótica a partir de tan solo 30 minutos de datos de robot, en comparación con horas con enfoques anteriores. BFL está preparando el despliegue: FLUX 3 Image (sucesor de imagen estática de FLUX.2) se envía en las próximas semanas, FLUX 3 Action para socios comerciales en paralelo, y FLUX 3 Dev de pesos abiertos planeado para más tarde en 2026.
Para profesionales, esto unifica una apuesta arquitectónica de larga data: que la generación de contenido e IA física comparten representación subyacente suficiente para que un modelo pueda servir a ambas. La historia de entrenamiento multimodal—aprender que las imágenes enseñan estructura, el vídeo enseña movimiento, el audio enseña causalidad, cada uno restringiendo los otros—hace eco del trabajo reciente en modelos del mundo. Sin embargo, los riesgos de ejecución permanecen: los números de vídeo de BFL son preliminares, FLUX 3 Image aún no está disponible para evaluación, y los pesos abiertos son una promesa posterior de 2026. Si BFL entrega pesos abiertos según el cronograma, FLUX 3 Dev será el primer modelo multimodal abierto que abarca vídeo, imagen, audio y acción en una arquitectura, reformulando la pila para constructores que eligen entre herramientas especializadas y plataformas unificadas.