DeepSWE
Un benchmark che verifica se un modello può portare a termine un lungo compito di ingegneria del software fino a ottenere un risultato funzionante.
DeepSWE testa qualcosa di più ristretto e più utile di “può scrivere codice”. Misura se un modello può eseguire un’attività software reale, che richiede molti passaggi su più file, e completarla senza perdere il thread a metà. Leggere il codice esistente, capire cosa cambiare, apportare la modifica, eseguire i test, riparare cosa si è rotto.
Questa resistenza è ciò che distingue un utile completamento automatico da qualcosa a cui puoi affidare un compito e da cui puoi allontanarti, motivo per cui i punteggi su di esso sono aumentati così bruscamente tra le generazioni di modelli. Un avvertimento che si applica a tutti i benchmark di codifica: funzionano su problemi curati in repository ordinati e la tua codebase non è né l’uno né l’altro.
-
Grok 4.7 Pensa più a lungo per gli stessi soldi e vince un benchmark dispari
-
Il nuovo modello di Sakana non è un modello, è un dispatcher per altri modelli
-
Gemini 3.8 Flash di Google mantiene il vecchio prezzo e porta un Cyber Twin
-
DeepSeek apre un modello da 305 miliardi di parametri che finalmente può vedere
-
Il GLM-5.3-Flash di Z.ai si avvicina all'Opus a un decimo del prezzo
-
È apparso un modello di classe Frontiera senza nome ed è gratuito fino alla prossima settimana
-
GLM-5.3 è diventato molto più bravo ad attaccare software, quindi Z.ai ritarda i pesi
-
Gemini 3.7 Flash di Google è migliore nel codice e costa la metà
-
Grok 4.5 arriva a un terzo del prezzo, e questo potrebbe contare più dei benchmark