Modèle garde-fou
Un petit modèle supplémentaire qui se place à côté d'un chatbot et vérifie si un message ou une réponse enfreint les règles.
Lorsqu’une entreprise exploite un chatbot IA, le modèle de chat lui-même est rarement le seul élément impliqué. Un deuxième modèle, beaucoup plus petit, lit chaque message entrant et souvent chaque réponse sortante, et signale tout ce qui viole la politique de l’opérateur. Ce vérificateur est le modèle de garde-fou, et c’est pourquoi un chatbot s’arrête parfois au milieu d’une phrase ou refuse de continuer.
Les modèles de garde-corps plus anciens étaient formés sur une liste fixe de catégories, donc l’ajout d’une nouvelle règle impliquait un recyclage. Les plus récents, tels que Shieldstral de Mistral ou gpt-oss-safeguard d’OpenAI, prennent la politique sous forme de texte brut au moment du contrôle, ce qui les rend réglables sans toucher aux poids.