AA-Omniscience
Una prueba que premia a un modelo por decir 'no lo sé' en lugar de inventarse una respuesta.
La mayoría de las pruebas solo preguntan si una respuesta fue correcta. AA-Omniscience, gestionada por la firma de análisis Artificial Analysis, pregunta además qué hace un modelo cuando no tiene ni idea. Las respuestas equivocadas dichas con seguridad restan puntos y reconocer honestamente que no se sabe algo suma, así que un modelo puede mejorar su resultado sin aprender ni un solo dato nuevo, simplemente adivinando menos.
Eso la convierte en una de las cifras más útiles si usted depende de la IA para investigar o para cualquier cosa factual. Un modelo puede saber mucho y aun así ser un mal asistente de investigación si rellena cada hueco con algo plausible. Las tasas de alucinación de esta prueba le dicen qué tipo de fallo está comprando.