CourionAI
FR
Newsletter
← Glossaire Terme

Grand ensemble de données vidéo

Collection ouverte de formation vidéo de LAION d'août 2026, couvrant environ 10 millions d'heures de séquences avec des sous-titres écrits automatiquement pour l'image et le son.

Le Big Video Dataset est une collection de formation ouverte publiée par l’association à but non lucratif LAION. L’équipe est partie de 1,3 milliard de liens vidéo trouvés dans Common Crawl, en a téléchargé 80 millions, totalisant environ 10 millions d’heures, et les a découpés en 55 millions de clips plus 300 millions d’images fixes. La plupart du matériel provient de YouTube et est en grande partie en anglais, ce qui vous renseigne sur les préjugés dont tout modèle formé sur ce sujet héritera.

Ce qui le rend précieux pour la recherche, c’est l’étiquetage. Plutôt que de dépendre de la description qu’un humain a écrite, l’équipe a généré automatiquement des légendes pour les éléments visuels et audio, afin qu’un modèle puisse apprendre quelles images correspondent à quels mots et quels sons en même temps. Il est publié uniquement à des fins de recherche non commerciale et repose sur la même exemption de recherche allemande sur laquelle LAION s’appuie pour ses ensembles de données d’images.