← Glossario Termine
SWE-Bench
Un test molto diffuso sulla capacità dei modelli IA di correggere veri bug software.
SWE-Bench è un benchmark che misura se un’IA sappia risolvere veri problemi tratti da reali progetti software, non esercizi artificiali. I suoi punteggi sono i numeri più citati negli annunci dei modelli di programmazione, e la variante più difficile SWE-Bench Pro è arrivata quando i modelli hanno iniziato a saturare l’originale.
I benchmark sono imperfetti e i modelli possono essere ottimizzati per il test, ma SWE-Bench resta il segnale onesto più rapido delle capacità di programmazione.
Citato in
-
Perché Databricks ha scelto un modello open source cinese come motore quotidiano per la programmazione
-
OpenAI afferma che un terzo di un diffuso test di programmazione per l'IA è difettoso
-
La risposta di Anthropic al prezzo di Fable 5: lasciare che gestisca modelli più economici
-
MiniMax M3: un modello IA di fascia alta che puoi scaricare ed eseguire personalmente