Guardrail-Modell
Ein kleines Zusatzmodell, das neben einem Chatbot sitzt und prüft, ob eine Nachricht oder eine Antwort gegen die Regeln verstößt.
Wenn ein Unternehmen einen KI-Chatbot betreibt, ist das Chat-Modell selbst selten das Einzige, was im Kreislauf ist. Ein zweites, viel kleineres Modell liest jede eingehende Nachricht und oft auch jede ausgehende Antwort und markiert alles, was gegen die Richtlinien des Betreibers verstößt. Dieser Checker ist das Leitplankenmodell, und deshalb stoppt ein Chatbot manchmal mitten im Satz oder weigert sich, fortzufahren.
Ältere Leitplankenmodelle wurden anhand einer festen Liste von Kategorien trainiert, sodass das Hinzufügen einer neuen Regel ein erneutes Training erforderte. Neuere, wie Shieldstral von Mistral oder gpt-oss-safeguard von OpenAI, übernehmen die Richtlinie zum Zeitpunkt der Prüfung als Klartext, was sie anpassbar macht, ohne die Gewichte zu berühren.
-
We Are Building an Invention Meant to Outgrow Its Inventors
-
Anthropic lockert den Biologiefilter von Claude Fable 5 und reduziert blockierte Fragen um 85 Prozent
-
Mistral hat einen kostenlosen Sicherheitsfilter herausgebracht, den Sie im Klartext beschreiben und der auf eine Grafikkarte passt
-
Du nutzt Fable 5 mit einem Claude-Abo? Am Montag ändert sich die Abrechnung