FLUX 3 quiere ser un solo modelo para imágenes, vídeo, audio e incluso acciones robóticas
La alemana Black Forest Labs presentó FLUX 3, un único modelo entrenado para generar imágenes y vídeos cortos con sonido, y ampliarse a la visión robótica. El acceso será limitado al principio.
Black Forest Labs, el laboratorio de Friburgo responsable de los populares modelos de imagen FLUX, anunció FLUX 3 el 23 de julio. La propuesta es ambiciosa: un solo modelo, entrenado simultáneamente con varios tipos de medios, capaz de generar imágenes, producir vídeos con sonido nativo de hasta 20 segundos, editar fotografías, representar texto legible e incluso predecir acciones para robots. La palabra clave es «multimodal»: el modelo maneja varios tipos de datos, imágenes, vídeo y audio, en lugar de limitarse al texto.
La afirmación técnica importante es cómo está construido. Muchas herramientas «todo en uno» son en realidad varios modelos independientes conectados detrás de una interfaz. Black Forest Labs dice que FLUX 3 se ha entrenado conjuntamente con imágenes, vídeo y audio, y comparte un único conjunto de pesos. Los pesos son las cifras internas que aprende un modelo durante el entrenamiento; compartir un conjunto implica que el mismo sistema hace todos los trabajos sin pasarlos a especialistas. En teoría, eso da resultados más coherentes entre formatos.
Detrás hay una carrera por el territorio de la IA creativa. Durante unos años, la generación de imágenes y de vídeo vivieron en herramientas distintas de empresas diferentes. La nueva frontera es un solo modelo capaz de hacerlo todo, y que un laboratorio europeo marque su posición importa para quien no quiera depender únicamente de proveedores estadounidenses. También hay un objetivo a más largo plazo: ampliar el mismo modelo a la visión y las acciones de robots apunta a la «IA física», donde el software que imagina una imagen y el que dirige una máquina empiezan a converger.
Algunas salvedades concretas. FLUX 3 se está desplegando por fases. FLUX 3 Video está ahora en acceso anticipado; FLUX 3 Image y FLUX 3 Action llegarán en las próximas semanas. Una versión de pesos abiertos llamada FLUX 3 Dev, que se podrá ejecutar y personalizar en hardware propio, está prevista para más adelante en 2026, pero aún no existe. Por tanto, las capacidades anunciadas son reales pero están restringidas, y la versión que querrán muchos aficionados sigue siendo una promesa.
Qué significa esto para ti: Si crea imágenes, vídeos cortos o contenido para redes sociales, merece la pena seguir FLUX 3: una herramienta para imagen, vídeo y sonido podría sustituir varias aplicaciones. Si solo siente curiosidad, la señal más interesante es la dirección: las herramientas multimedia de IA se están fusionando en modelos únicos, y uno de los líderes es europeo. Para la mayoría, el momento práctico llegará cuando FLUX 3 Dev se publique con pesos abiertos y pueda probarse sin cola. Hasta entonces, mantenga expectativas realistas y trate las demostraciones como demostraciones.
Fuentes
ChatGPT ya puede leer su historial médico: es práctico y merece reflexión
OpenAI lanzó Health en ChatGPT el 23 de julio para adultos estadounidenses, que pueden conectar historiales médicos y Apple Health. Es realmente útil, pero los expertos señalan una contrapartida real para la privacidad.