CourionAI
DE
Newsletter
← Glossar Begriff

KI-Alignment

Die Arbeit, ein Modell dazu zu bringen, sich tatsächlich so zu verhalten, wie seine Hersteller es beabsichtigen, einschließlich der Ablehnung schädlicher Anfragen.

Ausrichtung ist die weit gefasste Bezeichnung dafür, dass sich ein Modell so verhält, wie es seine Hersteller beabsichtigen. Ein auf Text trainiertes Rohmodell setzt jeden Satz, den Sie ihm geben, gerne fort, auch unangenehme. Ausrichtung ist das zusätzliche Training, das ihm beibringt, hilfreich zu sein, gefährliche Anfragen abzulehnen, Unsicherheit zuzugeben und Stereotypen zu vermeiden. Ablehnungstraining, bei dem ein Model lernt, auf bestimmte Anfragen Nein zu sagen, ist ein Teil davon.

Das Komische daran ist, dass es sich bei der Ausrichtung um ein stumpfes Instrument handelt. Einem Modell beizubringen, einen Fehler zu vermeiden, führt oft zu einem anderen: Eine Studie aus dem Jahr 2026 ergab, dass Modelle, die darauf trainiert wurden, Geschlechterstereotypisierungen zu vermeiden, weibliche Charaktere am Ende fast vollständig löschten und stattdessen standardmäßig „es“ verwendeten. Ausrichtung ist auch nicht dasselbe wie Sicherheit, da Jailbreak-Eingabeaufforderungen sie umgehen können und sie vollständig verschwindet, wenn jemand die Gewichte eines Modells herunterlädt und sie neu trainiert.