CourionAI
ES
Boletín
← Todas las noticias
training-data 3 min de lectura

LAION publica 10 millones de horas de vídeo para la investigación de IA abierta

Big Video Dataset extrae 80 millones de vídeos de CommonCrawl, con subtítulos escritos por máquina tanto para imágenes como para sonido. Es sólo para investigación y la cuestión de los derechos de autor se encuentra justo debajo.

Una inmensa pared de archivo de carretes de película y cintas en forma de onda enrolladas apiladas como estantes de biblioteca en la distancia.

LAION, la organización alemana sin fines de lucro más conocida por el conjunto de datos de imágenes detrás de Stable Diffusion, ha lanzado Big Video Dataset, una de las colecciones de videos abiertos más grandes jamás publicadas para la investigación de IA. El equipo partió de 1.300 millones de URL de vídeos encontrados en CommonCrawl, un archivo público de la web, descargó 80 millones de esos vídeos, con un total de alrededor de 10 millones de horas, luego los cortó en 55 millones de clips y extrajo 300 millones de imágenes fijas. La mayor parte del material proviene de YouTube y la mayor parte está en inglés.

La ingeniería interesante está en las etiquetas. En lugar de depender de cualquier descripción que un humano escribiera, el equipo utilizó la detección de escenas basada en el contenido para encontrar los límites de los clips y luego generó subtítulos tanto para las imágenes como para el audio automáticamente. El entrenamiento en esa combinación le enseña a un modelo qué imágenes van con qué palabras y qué sonidos, todo a la vez. Según el documento adjunto, los modelos entrenados en BVD superaron a los modelos comparables entrenados en el antiguo conjunto de datos de InternVid en hasta 2,1 puntos porcentuales en los puntos de referencia estándar de vídeo a texto. El conjunto de datos y el código están disponibles gratuitamente y se publican únicamente para uso en investigación.

Qué está pasando realmente aquí: cada modelo de IA capaz se basa en una pila de datos de entrenamiento, y en el caso del video, esa pila ha sido en su mayor parte privada. Google, OpenAI y ByteDance entrenan modelos de vídeo sobre material que nadie fuera de esas empresas puede inspeccionar. Eso hace imposible que los investigadores independientes verifiquen lo que ocurrió, reproduzcan un resultado o sesguen el estudio. Los conjuntos de datos abiertos solucionan ese problema y también son la única forma en que un laboratorio universitario puede competir. La parte incómoda es la base jurídica. LAION señala una sentencia de 2024 del Tribunal Regional de Hamburgo que le permitió recopilar imágenes protegidas por derechos de autor para investigaciones no comerciales y pide a los usuarios que respeten los derechos de los creadores. Esa es una exención de investigación, no un permiso, y es por eso que la divulgación es solo para investigación. A los creadores cuyos videos están aquí no se les preguntó, y no existe una forma práctica de preguntar 80 millones de veces.

Qué significa esto para usted: si está aprendiendo sobre IA, esta es una rara oportunidad de observar la materia prima en lugar del producto terminado. Los gráficos de composición del conjunto de datos por sí solos son instructivos: ver hasta qué punto dominan una plataforma y un idioma explica mucho sobre por qué los modelos de vídeo se comportan como lo hacen. Si es investigador, este es un recurso importante y vale la pena leer el artículo sobre el método de subtítulos. Si se gana la vida haciendo videos, el resumen honesto es que su trabajo bien puede estar aquí, que el lanzamiento se limita a investigaciones no comerciales y que la frontera entre el corpus de investigación y el conjunto de capacitación comercial ha sido históricamente delgada. Nada cambia para ti hoy, pero vale la pena conocer el terreno en el que te encuentras.

Fuentes

Fuentes: https://projects.laion.ai/bvd/

Siguiente artículo

Un robot de derechos de autor con IA eliminó un popular juego de código abierto de Google Play

Luanti, una plataforma de juegos de vóxel gratuita utilizada en las escuelas, fue eliminada de Play Store debido a un aviso de DMCA presentado por una empresa de detección de inteligencia artificial en nombre de Microsoft. Lo mismo sucedió en 2023.

Una garra mecánica que levanta una pila de cubos de un estante, dejando un espacio vacío entre las pilas vecinas.