CourionAI
ES
Boletín
← Glosario Término

Terminal-Bench

Una prueba de si un modelo de IA puede completar trabajo real desde una línea de comandos.

Terminal-Bench coloca un modelo ante un terminal, la ventana de texto donde los desarrolladores ejecutan comandos, y le da tareas que solo cuentan si la máquina termina en el estado correcto: instalar algo, reparar una compilación o superar pruebas. No hay puntos por una respuesta plausible.

Por eso aparece en los anuncios de agentes. Los benchmarks de chat premian escribir bien sobre una tarea; este premia completarla en varios pasos sin ayuda humana. Los resultados han subido rápido en 2026 y sirven como indicador del trabajo sin supervisión que puede confiarse a un asistente.