CourionAI
ES
Boletín
← Todas las noticias
open-weights 2 min de lectura

Mistral lanzó un filtro de seguridad gratuito que usted describe en inglés sencillo y cabe en una tarjeta gráfica

Shieldstral es un modelo de open weights de 3 mil millones de parámetros que compara texto e imágenes con una política que usted mismo escribe, en oraciones comunes, sin ningún reentrenamiento. Se ejecuta en una única GPU de 16 GB con una licencia Apache 2.0.

Un pequeño escudo que contiene una serie de tiras de papel y marcos de fotos, con una tarjeta de reglas en blanco clavada al lado.

El laboratorio francés Mistral ha publicado Shieldstral, un pequeño modelo abierto cuyo único trabajo es mirar un contenido y responder una pregunta de sí o no al respecto. Usted proporciona la pregunta en inglés normal. Pregúntele “¿Este contenido promueve la violencia física?” y devuelve una puntuación entre 0 y 1. Los pesos se pueden descargar gratis bajo una licencia Apache 2.0, que permite el uso comercial, y el modelo cabe en una única tarjeta gráfica de 16 GB.

Eso suena mundano hasta que sabes cómo funciona normalmente. La mayoría de los filtros de seguridad, a menudo llamados guardrail models, se entrenan en una lista fija de categorías: incitación al odio, autolesiones, armas, etc. Si su producto necesita una categoría que el modelo nunca le enseñó, puede volver a capacitarla o vivir sin ella. Shieldstral saca la política del entrenamiento y la coloca en el aviso. Mistral llama a esta política adaptativa: un punto de control, cualquier número de reglas, cambiadas cuando quieras.

El modelo está construido sobre la base Ministral 3B de Mistral con el codificador de visión Pixtral adjunto, por lo que lee imágenes además de texto, y cubre doce idiomas, incluidos alemán, francés, italiano y español. En las tablas de benchmark publicadas iguala o supera a los modelos con protección abierta varias veces su tamaño, y en la prueba de seguridad multimodal VLGuard obtiene una puntuación de 97,7 en la medida de F1 frente a 88,5 del siguiente mejor. Un veredicto es un paso único hacia adelante, lo que significa que el modelo produce un token y se detiene, por lo que es lo suficientemente económico como para ejecutarlo en cada mensaje en un chat en vivo.

Qué hay detrás de esto. Cada empresa que lanza un chatbot de repente necesita una capa de moderación, y las opciones obvias son una API de OpenAI o Google, o un modelo abierto grande que consume mucho hardware. Un modelo 3B que funciona con una tarjeta y sigue reglas escritas queda claramente entre ambos, y permite a una empresa europea realizar la verificación en sus propias máquinas. Mistral, que también vende modelos alojados, tiene un claro interés en ser el laboratorio que libere la pieza de cumplimiento.

Qué significa esto para ti: si solo usas herramientas de inteligencia artificial, nada cambia hoy, aunque filtros como este son la razón por la que un chatbot a veces rechaza una pregunta. Si construye o ejecuta cualquier cosa con un cuadro de chat, una plataforma escolar, una bandeja de entrada de soporte, un foro comunitario, esta es una opción seria que no cuesta nada en tarifas de licencia. Dos advertencias honestas del propio modelo de tarjeta de Mistral: la confiabilidad varía según el idioma, y ​​el texto deliberadamente ofuscado, como ortografía inusual o caracteres codificados, puede pasar desapercibido. Trátelo como un filtro, no como una garantía.

Fuentes

Fuentes: https://mistral.ai/news/shieldstral/

Siguiente artículo

Un modelo de 80 mil millones de parámetros ahora se ejecuta en una Mac normal con 4,3 GB de memoria y uno de 35 mil millones de parámetros se ejecuta en un iPhone.

Swiftlet es un tiempo de ejecución abierto que transmite los pesos expertos de un modelo desde el SSD en lugar de cargarlos en la memoria. Un modelo Qwen con 80 mil millones de parámetros alcanza un máximo de 4,3 GB de RAM en una Mac. La desventaja es la velocidad y una descarga grande.

Una computadora portátil y un teléfono conectados por una delgada cinta a un vasto almacén de cajones, uno de los cuales se abre cuando se lo solicita.