Contamination de référence
Lorsque les questions d'un test ont été divulguées dans les données d'entraînement d'un modèle, un score élevé reflète la mémoire plutôt que la capacité.
Les benchmarks sont censés mesurer ce qu’un modèle peut produire. La contamination est ce qui se produit lorsque les réponses se trouvaient depuis le début dans les données d’entraînement, de sorte que le modèle reconnaît la question au lieu de la résoudre. Étant donné que les modèles sont formés sur d’énormes fragments du Web public et que les benchmarks sont publiés sur le Web public, cela se produit constamment et est souvent impossible à prouver après coup.
L’effet pratique est une inflation des scores qui ressemble à un progrès. Une étude de 2026 portant sur 60 benchmarks a révélé que près de la moitié présentaient des signes de saturation, ce qui signifie que les scores s’étaient regroupés près du sommet de manière à ne plus séparer les modèles forts des modèles faibles. Le correctif est une conception résistante à la contamination : utilisez le matériel publié après la date limite de formation, supprimez les détails d’identification qui permettraient à un modèle de reconnaître la source et gèlez chaque cas de test. Le benchmark Reconstruction, publié en août 2026, en est un exemple strict, et les modèles frontières ont obtenu des résultats bien inférieurs à ceux des tests comparables avec des entrées plus riches.