← Glosario Término
Terminal-Bench
Una prueba de si un modelo de IA puede completar trabajo real desde una línea de comandos.
Terminal-Bench coloca un modelo ante un terminal, la ventana de texto donde los desarrolladores ejecutan comandos, y le da tareas que solo cuentan si la máquina termina en el estado correcto: instalar algo, reparar una compilación o superar pruebas. No hay puntos por una respuesta plausible.
Por eso aparece en los anuncios de agentes. Los benchmarks de chat premian escribir bien sobre una tarea; este premia completarla en varios pasos sin ayuda humana. Los resultados han subido rápido en 2026 y sirven como indicador del trabajo sin supervisión que puede confiarse a un asistente.
Mencionado en
-
GLM-5.3 mejoró mucho al atacar software, así que Z.ai retrasa sus pesos
-
Qwen3.8-27B ya está disponible y funciona en una sola tarjeta gráfica de juegos
-
Meta dio a su agente de IA un segundo agente cuya única tarea es recordar
-
Un pequeño modelo abierto de programación acaba de superar a rivales diez veces mayores, y puedes ejecutarlo tú mismo
-
Grok 4.5 llega por un tercio del precio, y eso podría importar más que las pruebas