CourionAI
FR
Newsletter
← Glossaire Terme

Training data

L'ensemble de textes, d'images et de code dont un modèle apprend, et la partie que les laboratoires décrivent le moins volontiers.

Les données d’entraînement regroupent tout ce qu’un modèle a vu pendant sa construction : pages web, livres, dépôts de code, images et transcriptions. Le modèle ne stocke pas ces fichiers. Il ajuste des millions de nombres internes, ses poids de modèle, jusqu’à savoir prédire ce qui vient ensuite dans des contenus similaires. Tout ce qu’un modèle semble connaître remonte à ce sur quoi il a été entraîné, ce qui explique aussi pourquoi ses angles morts et ses biais reflètent souvent ses sources.

C’est la couche la moins transparente de l’IA moderne. La plupart des laboratoires indiquent la taille d’un modèle et ses résultats aux benchmarks, mais pas ce qui l’a nourri, en partie pour des raisons de concurrence et en partie parce que les questions de droit d’auteur sur les contenus récupérés passent encore devant les tribunaux. Des projets comme OpenWALDO cherchent à changer cela en créant des corpus où chaque document porte une licence et une origine.