Red Teaming
Das eigene System absichtlich angreifen, um herauszufinden, wie es bricht, bevor es jemand anders tut.
Red Teaming stammt aus der Militär- und Sicherheitspraxis: Eine Gruppe spielt den Angreifer und versucht, die Verteidigung zu durchbrechen, damit die Verteidiger ihre Lücken kennenlernen. Bei KI bedeutet es Menschen, deren Aufgabe es ist, ein Modell zu Fehlverhalten zu bringen. Sie versuchen, ihm gefährliche Anleitungen zu entlocken, es mit verstecktem Text zu täuschen oder es in Situationen zu drängen, die seine Entwickler nie bedacht haben.
Labore führen Red Teaming vor der Veröffentlichung durch und legen die Ergebnisse als Beleg vor, ein System sei sicher genug. Solche Aussagen lohnen genaues Lesen. Red Teaming zeigt, was die Testenden gefunden haben, nicht was existiert, es kann also eine Schwäche nachweisen, aber nie deren Abwesenheit. Außerdem ist es am stärksten gegen Angriffe, die man bereits kennt, weshalb neue Angriffsarten immer wieder bei Modellen durchkommen, die ihre Tests bestanden hatten.
-
Das Ansehen seines eigenen Modells kostet OpenAI jetzt 20 Prozent mehr, und dafür wurde ein Trainingslauf unterbrochen
-
Claude Code aktiviert standardmäßig den automatischen Modus und die Sicherheitszahlen entsprechen nicht Ihren Erwartungen
-
Anthropic: Claude entdeckt echte Schwächen in zwei Verschlüsselungsverfahren