DeepSWE
Un punto de referencia que prueba si un modelo puede llevar a cabo una larga tarea de ingeniería de software hasta obtener un resultado funcional.
DeepSWE prueba algo más limitado y útil que “puede escribir código”. Mide si un modelo puede realizar una tarea de software real, una que necesita muchos pasos en varios archivos, y finalizarla sin perder el hilo a la mitad. Leer el código existente, determinar qué cambiar, realizar el cambio, ejecutar las pruebas y arreglar lo que falló.
Esa resistencia es lo que separa un autocompletado útil de algo a lo que puedes asignarle una tarea y de lo que puedes alejarte, razón por la cual las puntuaciones han aumentado tan bruscamente entre generaciones de modelos. Una advertencia que se aplica a todos los puntos de referencia de codificación: se ejecutan en problemas seleccionados en repositorios ordenados, y su base de código no es ninguna de las dos cosas.
-
Grok 4.7 piensa más por el mismo dinero y obtiene un punto de referencia extraño
-
El nuevo modelo de Sakana no es un modelo, es un despachador de otros modelos
-
Gemini 3.8 Flash de Google mantiene el precio anterior y trae un Cyber Twin
-
DeepSeek abre un modelo de 305 mil millones de parámetros que finalmente puede ver
-
El GLM-5.3-Flash de Z.ai se acerca al Opus a una décima parte del precio
-
Apareció un modelo Frontier-Class sin nombre y es gratuito hasta la próxima semana
-
GLM-5.3 mejoró mucho al atacar software, así que Z.ai retrasa sus pesos
-
Gemini 3.7 Flash de Google es mejor en código y cuesta la mitad
-
Grok 4.5 llega por un tercio del precio, y eso podría importar más que las pruebas