Training data
L'ensemble de textes, d'images et de code dont un modèle apprend, et la partie que les laboratoires décrivent le moins volontiers.
Les données d’entraînement regroupent tout ce qu’un modèle a vu pendant sa construction : pages web, livres, dépôts de code, images et transcriptions. Le modèle ne stocke pas ces fichiers. Il ajuste des millions de nombres internes, ses poids de modèle, jusqu’à savoir prédire ce qui vient ensuite dans des contenus similaires. Tout ce qu’un modèle semble connaître remonte à ce sur quoi il a été entraîné, ce qui explique aussi pourquoi ses angles morts et ses biais reflètent souvent ses sources.
C’est la couche la moins transparente de l’IA moderne. La plupart des laboratoires indiquent la taille d’un modèle et ses résultats aux benchmarks, mais pas ce qui l’a nourri, en partie pour des raisons de concurrence et en partie parce que les questions de droit d’auteur sur les contenus récupérés passent encore devant les tribunaux. Des projets comme OpenWALDO cherchent à changer cela en créant des corpus où chaque document porte une licence et une origine.
-
Un modèle de 2,5 milliards de paramètres qui bat les plus grands et fonctionne sur votre ordinateur portable
-
Le ministère américain de la Justice déclare à un tribunal que la formation de l'IA sur des livres protégés par le droit d'auteur est une utilisation équitable
-
DeepSeek ouvre un modèle de 305 milliards de paramètres qui permet enfin de voir
-
LAION publie 10 millions d’heures de vidéo pour la recherche ouverte sur l’IA
-
Google verrouille son propre modèle hors des questions de test
-
Ce robot apprend une tâche de dix minutes en regardant une vidéo
-
Adobe Firefly peut désormais créer la musique, la voix off et les effets sonores
-
Ce robot apprend une nouvelle tâche à partir d'une courte vidéo, aucune formation requise
-
We Are Building an Invention Meant to Outgrow Its Inventors
-
Debian vote pour décider si l'IA peut toucher à son code
-
Le fondateur de Rocky Linux veut ouvrir la partie la plus secrète de l'IA : les données d'entraînement
-
Karpathy a transformé un paragraphe de Tolkien en scène 3D pour dix dollars et a appelé cela un vibe check.