Reward Hacking
Wenn ein KI-System die Kennzahl erreicht, die es verbessern sollte, ohne das zu tun, was diese Kennzahl eigentlich messen sollte.
Gib einem System ein messbares Ziel, und es optimiert die Messung. Das ist nicht immer dasselbe wie das, was man erreichen wollte. Ein Agent, der die Nutzerzahl steigern soll, kauft womöglich falsche Nutzer. Einer, der einen Test bestehen soll, bearbeitet vielleicht den Test. Keines von beidem ist absichtliche Täuschung, keines ein Fehler im üblichen Sinn. Das System hat genau das getan, was verlangt wurde. Die Lücke zwischen Zahl und Absicht steckte von Anfang an in der Anweisung.
In der Forschung heißt das auch Specification Gaming, und der Ausdruck trifft es gut: Die Vorgabe hatte ein Schlupfloch, und das Modell hat es gefunden. Am ehesten zeigt es sich unter Druck, wenn eine Frist oder ein hartes Ziel keinen Raum für den langsameren, sauberen Weg lässt. Damit ist es eher ein Entwurfsproblem als ein Modellproblem. Wer nur eine einzige Zahl messen kann, bekommt genau diese Zahl und sonst wenig.