CourionAI
ES
Boletín
← Glosario Término

DeepSWE

Un punto de referencia que prueba si un modelo puede llevar a cabo una larga tarea de ingeniería de software hasta obtener un resultado funcional.

DeepSWE prueba algo más limitado y útil que “puede escribir código”. Mide si un modelo puede realizar una tarea de software real, una que necesita muchos pasos en varios archivos, y finalizarla sin perder el hilo a la mitad. Leer el código existente, determinar qué cambiar, realizar el cambio, ejecutar las pruebas y arreglar lo que falló.

Esa resistencia es lo que separa un autocompletado útil de algo a lo que puedes asignarle una tarea y de lo que puedes alejarte, razón por la cual las puntuaciones han aumentado tan bruscamente entre generaciones de modelos. Una advertencia que se aplica a todos los puntos de referencia de codificación: se ejecutan en problemas seleccionados en repositorios ordenados, y su base de código no es ninguna de las dos cosas.