Modelo guardrail
Un pequeño modelo adicional situado junto a un chatbot para comprobar si un mensaje o una respuesta infringe las reglas.
Cuando una empresa ofrece un chatbot de IA, el modelo de conversación rara vez es el único componente del proceso. Un segundo modelo mucho más pequeño lee cada mensaje entrante y, a menudo, cada respuesta saliente para señalar aquello que incumple la política del operador. Ese verificador es el modelo guardrail. Por eso, un chatbot a veces se detiene a mitad de una frase o se niega a continuar.
Los modelos guardrail antiguos se entrenaban con una lista fija de categorías, de modo que añadir una regla exigía repetir el entrenamiento. Los nuevos, como Shieldstral de Mistral o gpt-oss-safeguard de OpenAI, reciben la política como texto corriente en el momento de la comprobación. Así se pueden ajustar sin tocar los pesos.
-
We Are Building an Invention Meant to Outgrow Its Inventors
-
Anthropic afloja el filtro biológico de Claude Fable 5, reduciendo las preguntas bloqueadas en un 85 por ciento
-
Mistral lanzó un filtro de seguridad gratuito que usted describe en inglés sencillo y cabe en una tarjeta gráfica
-
¿Usas Fable 5 con una suscripción a Claude? El lunes cambia la forma de pagarlo