CourionAI
FR
Newsletter
← Glossaire Terme

ExploitBench

Un test qui vérifie si un modèle peut dépasser la simple découverte d'une faille et construire une attaque fonctionnelle.

Trouver une vulnérabilité et l’exploiter sont deux compétences différentes. CyberGym mesure la première: un modèle peut-il repérer et confirmer une faille dans du code source? ExploitBench et sa version chronométrée ExploitGym mesurent la seconde: peut-il raisonner sur la chaîne d’étapes qui transforme cette faille en attaque réellement fonctionnelle?

Ces scores comptent davantage que beaucoup de benchmarks, car ils correspondent à un risque réel dans les deux sens. La même capacité qui permet d’écrire un exploit aide les défenseurs à trouver des failles vieilles de plusieurs décennies avant un attaquant. C’est pourquoi les laboratoires publient désormais ces chiffres avec leurs résultats de programmation et retardent parfois une sortie à cause d’eux.