CourionAI
ES
Boletín
← Todas las noticias
ai-video 2 min de lectura

FLUX 3 quiere ser un solo modelo para imágenes, vídeo, audio e incluso acciones robóticas

La alemana Black Forest Labs presentó FLUX 3, un único modelo entrenado para generar imágenes y vídeos cortos con sonido, y ampliarse a la visión robótica. El acceso será limitado al principio.

Ilustración en risografía de un prisma de cristal que divide la luz en un marco, una tira de película, ondas sonoras y un pequeño brazo robótico

Black Forest Labs, el laboratorio de Friburgo responsable de los populares modelos de imagen FLUX, anunció FLUX 3 el 23 de julio. La propuesta es ambiciosa: un solo modelo, entrenado simultáneamente con varios tipos de medios, capaz de generar imágenes, producir vídeos con sonido nativo de hasta 20 segundos, editar fotografías, representar texto legible e incluso predecir acciones para robots. La palabra clave es «multimodal»: el modelo maneja varios tipos de datos, imágenes, vídeo y audio, en lugar de limitarse al texto.

La afirmación técnica importante es cómo está construido. Muchas herramientas «todo en uno» son en realidad varios modelos independientes conectados detrás de una interfaz. Black Forest Labs dice que FLUX 3 se ha entrenado conjuntamente con imágenes, vídeo y audio, y comparte un único conjunto de pesos. Los pesos son las cifras internas que aprende un modelo durante el entrenamiento; compartir un conjunto implica que el mismo sistema hace todos los trabajos sin pasarlos a especialistas. En teoría, eso da resultados más coherentes entre formatos.

Detrás hay una carrera por el territorio de la IA creativa. Durante unos años, la generación de imágenes y de vídeo vivieron en herramientas distintas de empresas diferentes. La nueva frontera es un solo modelo capaz de hacerlo todo, y que un laboratorio europeo marque su posición importa para quien no quiera depender únicamente de proveedores estadounidenses. También hay un objetivo a más largo plazo: ampliar el mismo modelo a la visión y las acciones de robots apunta a la «IA física», donde el software que imagina una imagen y el que dirige una máquina empiezan a converger.

Algunas salvedades concretas. FLUX 3 se está desplegando por fases. FLUX 3 Video está ahora en acceso anticipado; FLUX 3 Image y FLUX 3 Action llegarán en las próximas semanas. Una versión de pesos abiertos llamada FLUX 3 Dev, que se podrá ejecutar y personalizar en hardware propio, está prevista para más adelante en 2026, pero aún no existe. Por tanto, las capacidades anunciadas son reales pero están restringidas, y la versión que querrán muchos aficionados sigue siendo una promesa.

Qué significa esto para ti: Si crea imágenes, vídeos cortos o contenido para redes sociales, merece la pena seguir FLUX 3: una herramienta para imagen, vídeo y sonido podría sustituir varias aplicaciones. Si solo siente curiosidad, la señal más interesante es la dirección: las herramientas multimedia de IA se están fusionando en modelos únicos, y uno de los líderes es europeo. Para la mayoría, el momento práctico llegará cuando FLUX 3 Dev se publique con pesos abiertos y pueda probarse sin cola. Hasta entonces, mantenga expectativas realistas y trate las demostraciones como demostraciones.

Fuentes

Fuentes: https://www.globenewswire.com/news-release/2026/07/23/3332364/0/en/black-forest-labs-unveils-flux-3-a-new-multimodal-frontier-model-for-visual-intelligence.html

Siguiente artículo

ChatGPT ya puede leer su historial médico: es práctico y merece reflexión

OpenAI lanzó Health en ChatGPT el 23 de julio para adultos estadounidenses, que pueden conectar historiales médicos y Apple Health. Es realmente útil, pero los expertos señalan una contrapartida real para la privacidad.

Ilustración en risografía de un corazón con una línea de pulso junto a una carpeta médica, un teléfono inteligente y un pequeño escudo protector