Letzte Prüfung der Agenten
Ein Benchmark langer mehrstufiger Aufgaben in realen Anwendungen, mit dem getestet wird, ob ein Agent seine Arbeit beenden kann, anstatt sie einfach zu starten.
Die letzte Prüfung der Agenten, meist mit ALE abgekürzt, testet Agenten auf die Art und Weise, wie ein neuer Kollege getestet wird: Hier ist eine echte Anwendung, hier ist eine Aufgabe mit vielen Schritten, los. Erfolg bedeutet, dass der Endzustand korrekt ist und nicht, dass die einzelnen Schritte auf dem Weg plausibel erschienen.
Diese Formulierung bestraft genau den Fehlermodus, über den sich die Leute am meisten beschweren. Ein Modell kann einen selbstbewussten, gut formulierten Plan erstellen und die eigentliche Arbeit trotzdem halb erledigt lassen, und ein Benchmark, der den Text bewertet, wird es nicht bemerken. ALE zählt nur, was sich geändert hat. Die Werte sind durchweg niedrig, was Ihnen ehrlich zeigt, wo sich autonome Agenten derzeit befinden.