Dernier examen des agents
Un benchmark de tâches longues en plusieurs étapes au sein d'applications réelles, utilisé pour tester si un agent peut terminer son travail plutôt que de simplement le démarrer.
Le dernier examen des agents, généralement abrégé en ALE, teste les agents de la même manière qu’un nouveau collègue est testé : voici une vraie application, voici une tâche avec de nombreuses étapes, allez-y. Le succès signifie que l’état final est correct, et non que les mouvements individuels semblent plausibles en cours de route.
Ce cadrage punit exactement le mode d’échec dont les gens se plaignent le plus. Un modèle peut produire un plan confiant et bien formulé tout en laissant le travail réel à moitié fait, et un référentiel qui note le texte ne le remarquera pas. ALE ne compte que ce qui a changé. Les scores sont faibles dans tous les domaines, ce qui vous indique honnêtement où se situent actuellement les agents autonomes.