Training data
L'ensemble de textes, d'images et de code dont un modèle apprend, et la partie que les laboratoires décrivent le moins volontiers.
Les données d’entraînement regroupent tout ce qu’un modèle a vu pendant sa construction : pages web, livres, dépôts de code, images et transcriptions. Le modèle ne stocke pas ces fichiers. Il ajuste des millions de nombres internes, ses poids de modèle, jusqu’à savoir prédire ce qui vient ensuite dans des contenus similaires. Tout ce qu’un modèle semble connaître remonte à ce sur quoi il a été entraîné, ce qui explique aussi pourquoi ses angles morts et ses biais reflètent souvent ses sources.
C’est la couche la moins transparente de l’IA moderne. La plupart des laboratoires indiquent la taille d’un modèle et ses résultats aux benchmarks, mais pas ce qui l’a nourri, en partie pour des raisons de concurrence et en partie parce que les questions de droit d’auteur sur les contenus récupérés passent encore devant les tribunaux. Des projets comme OpenWALDO cherchent à changer cela en créant des corpus où chaque document porte une licence et une origine.
-
We Are Building an Invention Meant to Outgrow Its Inventors
-
Debian vote pour décider si l'IA peut toucher à son code
-
Le fondateur de Rocky Linux veut ouvrir la partie la plus secrète de l'IA : les données d'entraînement
-
Karpathy a transformé un paragraphe de Tolkien en scène 3D pour dix dollars et a appelé cela un vibe check.