CourionAI
DE
Newsletter
← Glossar Begriff

Training data

Die Menge aus Texten, Bildern und Code, aus der ein Modell lernt, und der Teil, den Labore am wenigsten beschreiben wollen.

Trainingsdaten sind alles, was ein Modell während seiner Entwicklung gesehen hat: Webseiten, Bücher, Code-Repositories, Bilder und Transkripte. Das Modell speichert diese Dateien nicht. Es passt Millionen interner Zahlen, seine Modellgewichte, so an, dass es in ähnlichem Material gut vorhersagen kann, was als Nächstes kommt. Alles, was ein Modell zu wissen scheint, lässt sich auf seine Trainingsdaten zurückführen. Deshalb ähneln seine blinden Flecken und Vorurteile oft den Quellen.

Diese Schicht moderner KI ist am wenigsten transparent. Die meisten Labore verraten, wie groß ein Modell ist und wie es in Benchmarks abschneidet, aber nicht, was in es eingeflossen ist. Gründe sind der Wettbewerb und die weiterhin ungeklärten Urheberrechtsfragen rund um abgeschöpftes Material. Projekte wie OpenWALDO wollen das ändern und Korpora aufbauen, in denen jedes Dokument eine Lizenz und eine Herkunft trägt.