OSWorld
Ein Benchmark, der misst, wie gut ein KI-Modell einen echten Computer-Desktop bedienen und sich durch Anwendungen klicken kann, um alltägliche Aufgaben zu erledigen.
Die meisten Benchmarks stellen einem Modell Fragen. OSWorld stellt es vor ein tatsächliches Betriebssystem und fordert es auf, etwas zu erledigen: eine Datei öffnen, eine Tabelle bearbeiten, eine Einstellung ändern, in mehreren Anwendungen arbeiten. Die Punktzahlen geben den Prozentsatz korrekt erledigter Aufgaben an und sind viel niedriger als bei Text-Benchmarks, da das Fahren eines Desktops eine lange Kette von Schritten erfordert und jeder Fehler den Lauf beendet.
Es ist zum Standardbezugspunkt für das geworden, was man Computernutzung nennt. Wenn ein Labor behauptet, dass sein Modell Ihre Maschine in Ihrem Namen betreiben kann, ist OSWorld normalerweise die von ihm angegebene Zahl.