Mistral a publié un filtre de sécurité gratuit que vous décrivez en anglais simple et qui tient sur une seule carte graphique.
Shieldstral est un modèle à pondération ouverte de 3 milliards de paramètres qui vérifie le texte et les images par rapport à une politique que vous écrivez vous-même, dans des phrases ordinaires, sans aucun recyclage. Il fonctionne sur un seul GPU de 16 Go sous licence Apache 2.0.
Le laboratoire français Mistral a publié Shieldstral, un petit modèle ouvert dont le seul travail est de regarder un contenu et de répondre à une question par oui ou par non. Vous répondez à la question dans un anglais ordinaire. Demandez-lui : « Ce contenu encourage-t-il la violence physique ? » et il renvoie un score compris entre 0 et 1. Les poids sont téléchargeables gratuitement sous une licence Apache 2.0, qui permet une utilisation commerciale, et le modèle tient sur une seule carte graphique de 16 Go.
Cela semble banal jusqu’à ce que vous sachiez comment cela fonctionne normalement. La plupart des filtres de sécurité, souvent appelés guardrail models, sont formés sur une liste fixe de catégories : discours de haine, automutilation, armes, etc. Si votre produit a besoin d’une catégorie à laquelle le modèle n’a jamais été enseigné, soit vous le recyclez, soit vous vivez sans lui. Shieldstral déplace la politique hors de la formation vers l’invite. Mistral appelle cette politique adaptative : un point de contrôle, un nombre illimité de règles, modifiées à tout moment.
Le modèle est construit sur la base Ministral 3B de Mistral avec l’encodeur de vision Pixtral attaché, il lit donc les images ainsi que le texte, et couvre douze langues, dont l’allemand, le français, l’italien et l’espagnol. Dans les tableaux de benchmark publiés, il égale ou bat les modèles à garde ouverte plusieurs fois sa taille, et lors du test de sécurité multimodal VLGuard, il obtient un score de 97,7 sur la mesure F1 contre 88,5 pour le deuxième meilleur. Un verdict est une seule passe, ce qui signifie que le modèle produit un jeton et s’arrête, c’est pourquoi il est suffisamment bon marché pour être exécuté sur chaque message d’un chat en direct.
Qu’est-ce qui se cache derrière cela. Chaque entreprise qui livre un chatbot a soudainement besoin d’une couche de modération, et les options évidentes sont une API d’OpenAI ou de Google, ou un grand modèle ouvert qui consomme beaucoup de matériel. Un modèle 3B qui fonctionne sur une seule carte et suit des règles écrites se place parfaitement entre elles, et permet à une entreprise européenne d’effectuer le contrôle sur ses propres machines. Mistral, qui vend également des modèles hébergés, a clairement intérêt à être le laboratoire qui rend la conformité gratuite.
Ce que cela signifie pour vous: si vous utilisez uniquement des outils d’IA, rien ne change aujourd’hui, même si des filtres comme celui-ci sont la raison pour laquelle un chatbot refuse parfois une question. Si vous créez ou exécutez quelque chose contenant une boîte de discussion, une plate-forme scolaire, une boîte de réception d’assistance, un forum communautaire, il s’agit d’une option sérieuse qui ne coûte rien en frais de licence. Deux mises en garde honnêtes provenant de la propre carte modèle de Mistral : la fiabilité varie selon la langue, et un texte délibérément obscurci, comme une orthographe inhabituelle ou des caractères codés, peut échapper à celle-ci. Traitez-le comme un filtre et non comme une garantie.
Sources
Sources: https://mistral.ai/news/shieldstral/
Un modèle de 80 milliards de paramètres fonctionne désormais sur un Mac normal avec 4,3 Go de mémoire, et un modèle de 35 milliards sur un iPhone
Swiftlet est un environnement d'exécution ouvert qui diffuse les poids experts d'un modèle à partir du SSD au lieu de les charger en mémoire. Un modèle Qwen avec 80 milliards de paramètres culmine à 4,3 Go de RAM sur un Mac. Le compromis est la vitesse et un téléchargement volumineux.