DeepSWE
Un benchmark che verifica se un modello può portare a termine un lungo compito di ingegneria del software fino a ottenere un risultato funzionante.
DeepSWE testa qualcosa di più ristretto e più utile di “può scrivere codice”. Misura se un modello può eseguire un’attività software reale, che richiede molti passaggi su più file, e completarla senza perdere il thread a metà. Leggere il codice esistente, capire cosa cambiare, apportare la modifica, eseguire i test, riparare cosa si è rotto.
Questa resistenza è ciò che distingue un utile completamento automatico da qualcosa a cui puoi affidare un compito e da cui puoi allontanarti, motivo per cui i punteggi su di esso sono aumentati così bruscamente tra le generazioni di modelli. Un avvertimento che si applica a tutti i benchmark di codifica: funzionano su problemi curati in repository ordinati e la tua codebase non è né l’uno né l’altro.