← Glosario Término
SWE-Bench
Una prueba muy utilizada sobre la capacidad de los modelos para corregir errores reales de software.
SWE-Bench mide si una IA puede resolver incidencias reales de proyectos reales, no rompecabezas artificiales. Sus puntuaciones son las cifras más citadas en anuncios de modelos de programación, y la variante más difícil SWE-Bench Pro apareció cuando los modelos comenzaron a saturar la original.
Las pruebas son imperfectas y los modelos pueden optimizarse para ellas, pero SWE-Bench sigue siendo la señal honesta más rápida de capacidad para programar.
Mencionado en
-
Por qué Databricks acaba de convertir un modelo chino de código abierto en su motor de programación diario
-
OpenAI afirma que un tercio de una conocida prueba de programación para IA está defectuoso
-
La respuesta de Anthropic al precio de Fable 5: que gestione modelos más baratos
-
MiniMax M3: un modelo de IA de primer nivel que puedes descargar y ejecutar por tu cuenta