CourionAI
FR
Newsletter
← Glossaire Terme

Évaluation en double aveugle

Un test d'IA où l'évaluateur ne voit jamais le modèle et le propriétaire du modèle ne voit jamais les questions.

Empruntée à la médecine, où ni le patient ni le médecin ne savent qui a reçu le vrai médicament, une évaluation en double aveugle par l’IA maintient les deux parties dans l’ignorance du matériel de l’autre. L’organisation qui effectue le test ne voit jamais les pondérations du modèle, et l’entreprise qui a construit le modèle ne voit jamais les questions du test. Le but est de faire en sorte qu’une partition ait un sens pour un étranger.

Sans cela, vous rencontrez un problème familier. Si un laboratoire peut voir l’examen, il peut s’y préparer, et personne à l’extérieur ne peut distinguer un modèle véritablement performant d’un modèle bien expérimenté. Les contrats et les promesses de non-exploitation forestière étaient l’ancienne réponse, qui équivalait à de la confiance. Google DeepMind a mené la première évaluation de ce type d’un modèle frontière propriétaire avec le Singapore AI Safety Institute en août 2026, imposant la séparation avec l’informatique confidentielle plutôt qu’une promesse.