Training data
Die Menge aus Texten, Bildern und Code, aus der ein Modell lernt, und der Teil, den Labore am wenigsten beschreiben wollen.
Trainingsdaten sind alles, was ein Modell während seiner Entwicklung gesehen hat: Webseiten, Bücher, Code-Repositories, Bilder und Transkripte. Das Modell speichert diese Dateien nicht. Es passt Millionen interner Zahlen, seine Modellgewichte, so an, dass es in ähnlichem Material gut vorhersagen kann, was als Nächstes kommt. Alles, was ein Modell zu wissen scheint, lässt sich auf seine Trainingsdaten zurückführen. Deshalb ähneln seine blinden Flecken und Vorurteile oft den Quellen.
Diese Schicht moderner KI ist am wenigsten transparent. Die meisten Labore verraten, wie groß ein Modell ist und wie es in Benchmarks abschneidet, aber nicht, was in es eingeflossen ist. Gründe sind der Wettbewerb und die weiterhin ungeklärten Urheberrechtsfragen rund um abgeschöpftes Material. Projekte wie OpenWALDO wollen das ändern und Korpora aufbauen, in denen jedes Dokument eine Lizenz und eine Herkunft trägt.
-
Hollywood und der Besitzer von TikTok haben einen Waffenstillstand über AI-Video unterzeichnet, aber nicht den Teil, der am wichtigsten ist
-
We Are Building an Invention Meant to Outgrow Its Inventors
-
Debian stimmt darüber ab, ob KI seinen Code berühren darf
-
Der Rocky-Linux-Gründer will den einzigen Teil der KI öffnen, den niemand öffnet: die Trainingsdaten
-
Kleine Modelle lesen alte Bücher besser als große, und das kostet zwei Dollar pro tausend Seiten
-
Ein offenes Modell liegt nun Monate, nicht Jahre, hinter der Grenze zurück. Die Sicherheitsprüfung erfolgt nicht.
-
Karpathy verwandelte einen Absatz von Tolkien für zehn Dollar in eine 3D-Szene und nannte es einen Vibe Check
-
Mira Muratis Labor schrumpft sein Modell auf ein Viertel und verliert nur einen Punkt
-
Ein OpenAI-Forscher geht nach acht Monaten – weil bessere Daten für ihn wichtiger sind als größere Modelle
-
Mit Googles Lyria 3.5 lässt sich ein Teil eines KI-Songs reparieren, ohne alles neu zu erzeugen
-
Der größte Informatik-Fachverband diskutiert, ob KI Zugang zu seiner Bibliothek bekommen soll
-
Ein indisches Gericht nennt KI-Training „private Nutzung“, Verlage sollten das Kleingedruckte lesen
-
Wer ist wer: Black Forest Labs, das deutsche Labor hinter Photoshop und Canva
-
Robotern gehen die Trainingsdaten aus, deshalb zeichnet ein Start-up Gehirnwellen auf
-
Nicht alle glauben OpenAIs Geschichte vom abtrünnigen Agenten, und die Zweifel sind hörenswert
-
Ein offenes deutsches Modell hatte Testantworten in den Trainingsdaten, und dank Offenheit wissen wir es
-
Ein Hack enthüllt, womit ein KI-Musikgenerator trainiert wurde: zwei Millionen YouTube-Clips
-
Gleiche Frage, andere Antwort: Claude ist auf Hindi wärmer, auf Russisch strenger
-
Googles SensorFM will ein KI-Gehirn für alle Gesundheitsdaten deiner Wearables sein
-
Warum Databricks ausgerechnet ein chinesisches Open-Source-Modell zu seiner täglichen Programmier-Engine macht
-
MiniMax plant Berichten zufolge ein Open-Source-Modell mit 2,7 Billionen Parametern