CourionAI
FR
Newsletter
← Glossaire Terme

Terminal-Bench

Un test qui vérifie si un modèle d'IA peut accomplir un vrai travail depuis une ligne de commande.

Terminal-Bench place un modèle devant un terminal, la fenêtre de texte utilisée par les développeurs pour exécuter des commandes, et lui confie des tâches qui ne comptent comme terminées que si la machine atteint le bon état. Installer un logiciel, réparer une compilation cassée ou faire réussir une suite de tests. Une réponse plausible ne rapporte aucun point partiel.

C’est pourquoi ce score figure dans presque toutes les annonces d’agents. Les benchmarks de conversation récompensent une bonne explication de la tâche. Celui-ci récompense son accomplissement sur plusieurs étapes sans intervention humaine constante. Les scores ont progressé rapidement en 2026, ce qui en fait un indicateur raisonnable du travail non supervisé qu’un assistant peut réaliser.