CourionAI
IT
Newsletter
← Glossario Termine

Humanity's Last Exam

Un benchmark volutamente estremamente difficile con domande di esperti provenienti da molti settori specialistici.

L’ultimo esame dell’umanità prevede domande poste da esperti in dozzine di discipline selezionate in modo così difficile che le migliori modelle sbagliano la maggior parte. Ciò è avvenuto perché i benchmark più vecchi non mostravano quasi nessuna differenza con valori superiori al 90%.

A metà del 2026 i modelli forti sono ancora circa il 30%. Questo è esattamente ciò che si intende: misurare il divario rimanente. Come ogni benchmark individuale, l’HLE misura solo una gamma ristretta di competenze e non è un punteggio di intelligenza generale.