← Glossario Termine
Terminal-Bench
Un test per capire se un modello di IA sa completare un vero lavoro dalla riga di comando.
Terminal-Bench mette un modello davanti a un terminale, la finestra testuale usata dagli sviluppatori per eseguire comandi, e gli assegna lavori completati solo se la macchina raggiunge lo stato corretto: installare qualcosa, riparare una build o superare i test. Nessun punto per una risposta plausibile.
Per questo il punteggio appare negli annunci degli agenti. I benchmark di chat premiano un buon testo sul compito; questo premia l’esecuzione in più passaggi senza intervento umano. I punteggi sono saliti rapidamente nel 2026 e indicano quanto lavoro non supervisionato si può affidare a un assistente.
Citato in
-
GLM-5.3 è diventato molto più bravo ad attaccare software, quindi Z.ai ritarda i pesi
-
Qwen3.8-27B è disponibile e funziona su una sola scheda grafica da gioco
-
Meta ha dato al suo agente IA un secondo agente con un solo compito: ricordare
-
Un piccolo modello aperto per programmare ha appena battuto rivali dieci volte più grandi, e puoi eseguirlo tu stesso
-
Grok 4.5 arriva a un terzo del prezzo, e questo potrebbe contare più dei benchmark