CWE-Bench
Un benchmark esterno gestito da Collinear che misura la capacità dei modelli di intelligenza artificiale di scrivere patch corrette per le vulnerabilità software note.
Trovare un difetto di sicurezza e risolverlo sono competenze diverse e CWE-Bench testa la seconda. Ai modelli viene fornito un codice vulnerabile e viene assegnato un punteggio in base al fatto che la patch che scrivono chiude effettivamente il buco senza rompere nient’altro. I risultati sono solitamente indicati come pass@1, il che significa che la condivisione è stata corretta correttamente al primo tentativo.
È diventato un punto di riferimento comune nel 2026 perché i laboratori hanno iniziato a spedire modelli destinati specificamente ai difensori. Google ha riportato il 47,2% per Gemini 3.8 Flash Cyber, vicino al 47,8% del principale modello di frontiera ma a un costo per tentativo molto più basso, che è il tipo di compromesso che il benchmark è in grado di esporre.