← Glossario Termine
Terminal-Bench
Un test per capire se un modello di IA sa completare un vero lavoro dalla riga di comando.
Terminal-Bench mette un modello davanti a un terminale, la finestra testuale usata dagli sviluppatori per eseguire comandi, e gli assegna lavori completati solo se la macchina raggiunge lo stato corretto: installare qualcosa, riparare una build o superare i test. Nessun punto per una risposta plausibile.
Per questo il punteggio appare negli annunci degli agenti. I benchmark di chat premiano un buon testo sul compito; questo premia l’esecuzione in più passaggi senza intervento umano. I punteggi sono saliti rapidamente nel 2026 e indicano quanto lavoro non supervisionato si può affidare a un assistente.
Citato in
-
Grok 4.7 Pensa più a lungo per gli stessi soldi e vince un benchmark dispari
-
Il nuovo modello di Sakana non è un modello, è un dispatcher per altri modelli
-
Anthropic's Fable 5.1 costa lo stesso, ad eccezione della parte che gli agenti utilizzano maggiormente
-
DeepSeek apre un modello da 305 miliardi di parametri che finalmente può vedere
-
Il GLM-5.3-Flash di Z.ai si avvicina all'Opus a un decimo del prezzo
-
GLM-5.3 è diventato molto più bravo ad attaccare software, quindi Z.ai ritarda i pesi
-
Qwen3.8-27B è disponibile e funziona su una sola scheda grafica da gioco
-
Meta ha dato al suo agente IA un secondo agente con un solo compito: ricordare
-
Un piccolo modello aperto per programmare ha appena battuto rivali dieci volte più grandi, e puoi eseguirlo tu stesso
-
Grok 4.5 arriva a un terzo del prezzo, e questo potrebbe contare più dei benchmark