AA-Omniscience
Un test de référence qui récompense un modèle lorsqu'il dit 'je ne sais pas' au lieu d'inventer une réponse.
La plupart des tests demandent seulement si une réponse était juste. AA-Omniscience, gérée par le cabinet d’analyse Artificial Analysis, demande en plus ce que fait un modèle quand il n’en a aucune idée. Les réponses fausses assénées avec assurance sont pénalisées, et refuser honnêtement rapporte des points. Un modèle peut donc améliorer son score sans apprendre le moindre fait nouveau, simplement en devinant moins.
C’est l’un des chiffres les plus utiles si vous vous appuyez sur l’IA pour de la recherche ou pour quoi que ce soit de factuel. Un modèle peut être savant et rester un mauvais assistant de recherche s’il comble chaque lacune avec quelque chose de plausible. Les taux d’hallucination issus de ce test vous disent quel type de défaillance vous achetez.