CourionAI
DE
Newsletter
← Glossar Begriff

Reinforcement Learning

Eine Trainingsmethode, bei der ein Modell für gute Versuche belohnt wird, statt richtige Antworten vorgegeben zu bekommen.

Reinforcement Learning trainiert durch Versuch, Fehler und Belohnung. Statt korrekte Antworten zum Kopieren zu zeigen, bewertet man Versuche und verschiebt das Modell zu höher belohnten Ergebnissen. Der jüngste Qualitätssprung bei Reasoning-Modellen stammt überwiegend daher, nicht aus größeren Modellen.

Die Methode braucht ein zuverlässiges Richtig-oder-falsch-Signal. Code kompiliert oder nicht, mathematische Beweise stimmen oder nicht. Bei taktvollen E-Mails oder Geschäftsentscheidungen fehlt eine automatische Bewertung. Deshalb wirken Modelle ungleichmäßig: Besonders intensiv trainiert wurde, was sich leicht benoten ließ.