CourionAI
IT
Newsletter
← Tutte le notizie
open-weights 2 min di lettura

Mistral ha rilasciato un filtro di sicurezza gratuito che descrivi in un inglese semplice e si adatta a una scheda grafica

Shieldstral è un modello a open weights da 3 miliardi di parametri che controlla testo e immagini rispetto a una policy che scrivi tu stesso, in frasi ordinarie, senza alcuna riqualificazione. Funziona su una singola GPU da 16 GB con licenza Apache 2.0.

Un piccolo scudo che trattiene un flusso di foglietti e cornici, con un cartoncino bianco appuntato accanto

Il laboratorio francese Mistral ha pubblicato Shieldstral, un piccolo modello aperto il cui unico compito è guardare un contenuto e rispondere a una domanda sì o no al riguardo. Fornisci la domanda in inglese normale. Chiedigli “Questo contenuto promuove la violenza fisica?” e restituisce un punteggio compreso tra 0 e 1. I pesi possono essere scaricati gratuitamente con una licenza Apache 2.0, che ne consente l’uso commerciale, e il modello si adatta a una singola scheda grafica da 16 GB.

Sembra banale finché non sai come funziona normalmente. La maggior parte dei filtri di sicurezza, spesso chiamati modelli guardrail, sono addestrati su un elenco fisso di categorie: incitamento all’odio, autolesionismo, armi e così via. Se il tuo prodotto necessita di una categoria a cui il modello non è mai stato insegnato, o lo riqualifichi o vivi senza di essa. Shieldstral sposta la politica dalla formazione alla tempestività. Mistral definisce questa politica adattiva: un punto di controllo, un numero qualsiasi di regole, cambiate quando vuoi.

Il modello è costruito sulla base Ministral 3B di Mistral con il codificatore di visione Pixtral collegato, quindi legge immagini e testo e copre dodici lingue tra cui tedesco, francese, italiano e spagnolo. Nelle tabelle di benchmark pubblicate eguaglia o batte i modelli a protezione aperta molte volte più grandi delle sue dimensioni, e nel test di sicurezza multimodale VLGuard ottiene un punteggio di 97,7 nella misura F1 contro l’88,5 del miglior risultato successivo. Un verdetto è un singolo passaggio in avanti, il che significa che il modello produce un token e si ferma, motivo per cui è abbastanza economico da eseguire su ogni messaggio in una chat dal vivo.

Cosa c’è dietro. Ogni azienda che fornisce un chatbot ha improvvisamente bisogno di un livello di moderazione e le opzioni ovvie sono un’API di OpenAI o Google o un modello aperto di grandi dimensioni che consuma molto hardware. Un modello 3B che funziona su una scheda e segue regole scritte si colloca perfettamente tra questi due, e consente a un’azienda europea di mantenere il controllo sulle proprie macchine. Mistral, che vende anche modelli ospitati, ha un chiaro interesse ad essere il laboratorio che rende gratuito il pezzo di conformità.

Cosa significa per te: se utilizzi solo strumenti di intelligenza artificiale, oggi non cambia nulla, anche se filtri come questo sono il motivo per cui a volte un chatbot rifiuta una domanda. Se crei o esegui qualcosa che contenga una finestra di chat, una piattaforma scolastica, una casella di posta di supporto, un forum della comunità, questa è un’opzione seria che non costa nulla in termini di costi di licenza. Due onesti avvertimenti dalla scheda modello di Mistral: l’affidabilità varia in base alla lingua e il testo deliberatamente offuscato, come ortografie insolite o caratteri codificati, può sfuggire. Trattatelo come un filtro, non come una garanzia.

Fonti

Fonti: https://mistral.ai/news/shieldstral/

Articolo successivo

Un modello da 80 miliardi di parametri ora funziona su un normale Mac con 4,3 GB di memoria e uno da 35 miliardi su un iPhone

Swiftlet è un runtime aperto che trasmette in streaming i pesi esperti di un modello dall'SSD invece di caricarli in memoria. Un modello Qwen con 80 miliardi di parametri raggiunge il picco di 4,3 GB di RAM su un Mac. Il compromesso è la velocità e un download di grandi dimensioni.

Un laptop e un telefono collegati da un nastro sottile a un vasto magazzino di cassetti, un cassetto viene aperto su richiesta