CourionAI
IT
Newsletter
← Glossario Termine

SWE-Bench

Un test molto diffuso sulla capacità dei modelli IA di correggere veri bug software.

SWE-Bench è un benchmark che misura se un’IA sappia risolvere veri problemi tratti da reali progetti software, non esercizi artificiali. I suoi punteggi sono i numeri più citati negli annunci dei modelli di programmazione, e la variante più difficile SWE-Bench Pro è arrivata quando i modelli hanno iniziato a saturare l’originale.

I benchmark sono imperfetti e i modelli possono essere ottimizzati per il test, ma SWE-Bench resta il segnale onesto più rapido delle capacità di programmazione.