CourionAI
ES
Boletín
← Glosario Término

SWE-Bench

Una prueba muy utilizada sobre la capacidad de los modelos para corregir errores reales de software.

SWE-Bench mide si una IA puede resolver incidencias reales de proyectos reales, no rompecabezas artificiales. Sus puntuaciones son las cifras más citadas en anuncios de modelos de programación, y la variante más difícil SWE-Bench Pro apareció cuando los modelos comenzaron a saturar la original.

Las pruebas son imperfectas y los modelos pueden optimizarse para ellas, pero SWE-Bench sigue siendo la señal honesta más rápida de capacidad para programar.