OSWorld
Un benchmark che misura quanto bene un modello di intelligenza artificiale può gestire un vero computer desktop, facendo clic sulle applicazioni per completare le attività quotidiane.
La maggior parte dei benchmark pone domande al modello. OSWorld lo mette di fronte a un vero sistema operativo e gli chiede di fare qualcosa: aprire un file, modificare un foglio di calcolo, cambiare un’impostazione, lavorare su diverse applicazioni. I punteggi rappresentano la percentuale di attività completate correttamente e sono molto inferiori rispetto ai benchmark testuali perché la guida di un desktop comporta una lunga catena di passaggi in cui qualsiasi errore pone fine alla corsa.
È diventato il punto di riferimento standard per ciò che la gente chiama uso del computer. Quando un laboratorio afferma che il suo modello può utilizzare la tua macchina per tuo conto, OSWorld è solitamente il numero citato.