CourionAI
IT
Newsletter
← Glossario Termine

Terminal-Bench

Un test per capire se un modello di IA sa completare un vero lavoro dalla riga di comando.

Terminal-Bench mette un modello davanti a un terminale, la finestra testuale usata dagli sviluppatori per eseguire comandi, e gli assegna lavori completati solo se la macchina raggiunge lo stato corretto: installare qualcosa, riparare una build o superare i test. Nessun punto per una risposta plausibile.

Per questo il punteggio appare negli annunci degli agenti. I benchmark di chat premiano un buon testo sul compito; questo premia l’esecuzione in più passaggi senza intervento umano. I punteggi sono saliti rapidamente nel 2026 e indicano quanto lavoro non supervisionato si può affidare a un assistente.