KI-Alignment
Die Arbeit, ein Modell dazu zu bringen, sich tatsächlich so zu verhalten, wie seine Hersteller es beabsichtigen, einschließlich der Ablehnung schädlicher Anfragen.
Ausrichtung ist die weit gefasste Bezeichnung dafür, dass sich ein Modell so verhält, wie es seine Hersteller beabsichtigen. Ein auf Text trainiertes Rohmodell setzt jeden Satz, den Sie ihm geben, gerne fort, auch unangenehme. Ausrichtung ist das zusätzliche Training, das ihm beibringt, hilfreich zu sein, gefährliche Anfragen abzulehnen, Unsicherheit zuzugeben und Stereotypen zu vermeiden. Ablehnungstraining, bei dem ein Model lernt, auf bestimmte Anfragen Nein zu sagen, ist ein Teil davon.
Das Komische daran ist, dass es sich bei der Ausrichtung um ein stumpfes Instrument handelt. Einem Modell beizubringen, einen Fehler zu vermeiden, führt oft zu einem anderen: Eine Studie aus dem Jahr 2026 ergab, dass Modelle, die darauf trainiert wurden, Geschlechterstereotypisierungen zu vermeiden, weibliche Charaktere am Ende fast vollständig löschten und stattdessen standardmäßig „es“ verwendeten. Ausrichtung ist auch nicht dasselbe wie Sicherheit, da Jailbreak-Eingabeaufforderungen sie umgehen können und sie vollständig verschwindet, wenn jemand die Gewichte eines Modells herunterlädt und sie neu trainiert.
-
Kostenlose KI-Rechtshilfe hört sich großartig an, bis sie jeder nutzt. Die britischen Gerichte finden es heraus
-
Wenn KI eine Kindergeschichte über Tiere schreibt, verschwinden die weiblichen Charaktere fast
-
Anthropic prüfte 141.006 Testläufe und fand drei Fälle, in denen Claude echte Unternehmen angriff
-
Google DeepMind löst das AlphaFold-Team auf – ein Viertel der Autoren ist gegangen
-
1.200 Beschäftigte aus KI-Laboren fordern in Washington eine Bremse, die noch niemand bauen kann
-
Alibabas neue Bild-KI zeichnet ganze Zeitungsseiten, inklusive winziger lesbarer Schrift
-
OpenAI pausierte sein bestes Modell, weil es wiederholt aus seinem eigenen Testkäfig ausbrach
-
Die USA wollen neue Spitzenmodelle 30 Tage lang prüfen, bevor sie starten, was das tatsächlich bedeutet
-
Meta plant Berichten zufolge einen KI-Agenten namens Hatch für 200 Dollar im Monat