AA-Omniscience
Ein Benchmark, der ein Modell dafür belohnt, 'Ich weiß es nicht' zu sagen, statt eine Antwort zu erfinden.
Die meisten Benchmarks fragen nur, ob eine Antwort richtig war. AA-Omniscience, betrieben von der Analysefirma Artificial Analysis, fragt zusätzlich, was ein Modell tut, wenn es keine Ahnung hat. Selbstbewusst falsche Antworten kosten Punkte, ehrliches Ablehnen bringt welche. Ein Modell kann seinen Wert also verbessern, ohne einen einzigen neuen Fakt zu lernen, einfach indem es weniger rät.
Damit ist das eine der nützlicheren Zahlen, wenn Sie KI für Recherche oder irgendetwas Faktisches einsetzen. Ein Modell kann viel wissen und trotzdem ein schlechter Rechercheassistent sein, wenn es jede Lücke mit etwas Plausiblem füllt. Die Halluzinations-Raten aus diesem Benchmark sagen Ihnen, welche Art von Fehler Sie einkaufen.