LAION publie 10 millions d’heures de vidéo pour la recherche ouverte sur l’IA
Le Big Video Dataset extrait 80 millions de vidéos de CommonCrawl, avec des légendes écrites automatiquement pour l'image et le son. Il s'agit uniquement de recherche, et la question du droit d'auteur se situe juste en dessous.
LAION, l’organisation à but non lucratif allemande connue pour l’ensemble de données d’images derrière Stable Diffusion, a publié le Big Video Dataset, l’une des plus grandes collections de vidéos ouvertes jamais publiées pour la recherche sur l’IA. L’équipe est partie de 1,3 milliard d’URL de vidéos trouvées dans CommonCrawl, une archive publique du Web, a téléchargé 80 millions de ces vidéos totalisant environ 10 millions d’heures, puis les a découpées en 55 millions de clips et a extrait 300 millions d’images fixes. La plupart du matériel provient de YouTube et est en grande partie en anglais.
L’ingénierie intéressante réside dans les étiquettes. Plutôt que de s’appuyer sur la description qu’un humain a écrite, l’équipe a utilisé la détection de scène sensible au contenu pour trouver les limites des clips, puis a généré automatiquement des légendes pour les visuels et l’audio. La formation sur cette combinaison enseigne à un modèle quelles images vont avec quels mots et quels sons, tout à la fois. Selon le document d’accompagnement, les modèles formés sur BVD battent les modèles comparables formés sur l’ancien ensemble de données InternVid jusqu’à 2,1 points de pourcentage sur les références vidéo-texte standard. L’ensemble de données et le code sont disponibles gratuitement et destinés à la recherche uniquement.
Que se passe-t-il réellement ici : chaque modèle d’IA performant repose sur une pile de données d’entraînement, et pour la vidéo, cette pile est pour la plupart privée. Google, OpenAI et ByteDance entraînent des modèles vidéo sur du matériel que personne en dehors de ces entreprises ne peut inspecter. Cela empêche les chercheurs indépendants de vérifier ce qui s’est passé, de reproduire un résultat ou d’étudier les biais. Les ensembles de données ouvertes résolvent ce problème et constituent également le seul moyen pour un laboratoire universitaire d’être compétitif. Ce qui est inconfortable, c’est le fondement juridique. LAION rappelle une décision de 2024 du tribunal régional de Hambourg qui lui a permis de rassembler des images protégées par le droit d’auteur à des fins de recherche non commerciale, et demande aux utilisateurs de respecter les droits des créateurs. Il s’agit d’une exemption de recherche, pas d’une autorisation, et c’est pourquoi la diffusion est uniquement destinée à la recherche. Les créateurs dont les vidéos sont ici n’ont pas été interrogés, et il n’existe aucun moyen pratique de demander 80 millions de fois.
Ce que cela signifie pour vous : si vous découvrez l’IA, c’est une occasion rare d’examiner la matière première plutôt que le produit fini. Les graphiques de composition des ensembles de données sont à eux seuls instructifs : voir à quel point une plate-forme et un langage dominent explique en grande partie pourquoi les modèles vidéo se comportent comme ils le font. Si vous êtes un chercheur, il s’agit d’une ressource sérieuse et l’article vaut la peine d’être lu pour la méthode de sous-titrage. Si vous faites des vidéos pour gagner votre vie, le résumé honnête est que votre travail pourrait bien se trouver ici, que la diffusion est limitée à la recherche non commerciale et que la frontière entre le corpus de recherche et l’ensemble de formation commerciale a toujours été mince. Rien ne change pour vous aujourd’hui, mais cela vaut la peine de connaître le terrain sur lequel vous vous trouvez.
Sources
Sources: https://projects.laion.ai/bvd/
Un robot de droits d'auteur IA a retiré un jeu open source populaire de Google Play
Luanti, une plate-forme de jeu voxel gratuite utilisée dans les écoles, a été supprimée du Play Store suite à un avis DMCA déposé par une société de détection d'IA au nom de Microsoft. La même chose s’est produite en 2023.