Preparedness Framework
Le règlement interne d'OpenAI pour mesurer la dangerosité d'un modèle avant sa sortie et déterminer les garde-fous exigés à ce niveau.
Le Preparedness Framework est la manière dont OpenAI décide si un modèle est assez sûr pour être diffusé. Avant sa sortie, un modèle est noté dans une poignée de catégories de risque, dont la cybersécurité, les capacités biologiques et chimiques, et l’auto-amélioration de l’IA. Chaque catégorie reçoit une note, et franchir le seuil élevé déclenche un ensemble obligatoire de garde-fous plutôt qu’un simple oui ou non.
C’est la version OpenAI d’une politique que possèdent aujourd’hui tous les grands laboratoires; l’équivalent chez Anthropic est sa Responsible Scaling Policy. Ce sont des engagements volontaires et non une réglementation, ce qui fait à la fois leur intérêt et leur limite évidente: l’entreprise écrit les règles, mène les tests et corrige sa propre copie. L’utile pour les observateurs extérieurs, c’est que les résultats sont publiés: on peut donc voir ce qu’un laboratoire estime que son propre modèle sait faire.
-
OpenAI a construit un modèle qui écrit des exploits et l'a transmis à une courte liste d'entreprises
-
OpenAI affirme que son prochain modèle pourrait atteindre le niveau de cyber-risque le plus élevé et a suspendu une partie du travail
-
ChatGPT abandonne sa limite quotidienne pour les utilisateurs gratuits et passe à un modèle par défaut plus précis