CourionAI
FR
Newsletter
← Toutes les actus
ai-safety 3 min de lecture

Personne n'a réussi : le premier bulletin sur la façon dont les laboratoires d'IA contrôlent leurs propres systèmes

Guidelight a évalué Anthropic, OpenAI, Google, xAI et Meta sur six pratiques de contrôle interne de base. La meilleure note était un C plus, Meta un F et l'évaluation utilisait uniquement des documents publics.

Un bulletin de notes du presse-papiers avec des coches et des lettres de note à côté d'une loupe sur les racks de serveurs

Une organisation à but non lucratif appelée Guidelight a publié sa première évaluation de la manière dont les sociétés d’IA contrôlent les systèmes d’IA qu’elles gèrent en interne, et le résultat principal est brutal : aucune d’entre elles n’applique pleinement, même les mesures de base. Anthropic et OpenAI sont en tête avec un C plus. Google suit avec un D plus, accompagné d’une feuille de route détaillée d’amélioration. xAI obtient un D moins et Meta un F.

Guidelight a vérifié six pratiques, et la liste est moins exotique que ce à quoi on pourrait s’attendre. L’entreprise enregistre-t-elle ce que font ses systèmes d’IA internes ? Les actions risquées sont-elles encadrées par une étape de révision ? Existe-t-il un arrêt d’urgence, connu dans le domaine sous le nom de coupure de circuit ? Existe-t-il un plan pour contenir un modèle qui s’avère mal aligné, c’est-à-dire qui poursuit des objectifs autres que ceux visés ? La tendance dans les cinq sociétés était cohérente : elles sont les meilleures pour détecter quand quelque chose ne va pas, et les pires pour le prévenir ou le contenir par la suite. Guidelight a été fondée par deux anciens responsables de la sécurité d’OpenAI, Page Hedley et Steven Adler, et s’est appuyée uniquement sur des documents publics tels que des cartes système, des rapports de sécurité et des articles de blog.

Ce dernier détail va dans les deux sens, et c’est ici la juste mise en garde. Noter une entreprise en fonction de ce qu’elle a choisi de publier récompense la transparence plutôt que la sécurité réelle. Un laboratoire doté de contrôles internes stricts et ayant l’habitude de ne rien dire obtiendrait de mauvais résultats, tandis qu’un laboratoire qui rédige de longs articles de blog sur ses processus obtiendrait de bons résultats. Guidelight est franc à ce sujet, et c’est sans doute là l’essentiel : le groupe souhaite que la documentation publique devienne la norme précisément pour qu’une évaluation externe devienne possible. La raison pour laquelle tout cela est important maintenant est que les laboratoires utilisent de plus en plus eux-mêmes leurs modèles les plus performants. Anthropic a déclaré que Claude écrit la majeure partie du code dans ses systèmes de production, parfois via des agents fonctionnant en continu sans qu’un humain ne surveille chaque étape. L’entreprise qui s’est classée la meilleure n’a obtenu qu’un C plus.

Ce que cela signifie pour vous : pour la plupart des gens, rien ne change cette semaine. La valeur d’un rapport comme celui-ci réside dans le fait qu’il s’agit d’un tableau de bord que vous pouvez vérifier à nouveau dans six mois, ce qui est exactement l’intention de Guidelight. Si vous choisissez un fournisseur d’IA pour votre travail, les six critères constituent une liste de contrôle raisonnable à établir avec un fournisseur, et la réponse honnête à la question « pouvez-vous me montrer vos contrôles internes » vous en dit long. Et si vous suivez le débat sur la sécurité, notez la forme du constat : la détection est la partie la plus facile, la prévention et le confinement sont les parties les plus difficiles, et cela est également vrai pour la sécurité informatique ordinaire des entreprises.

##Sources

-Évaluation de contrôle août 2026, Guidelight

Sources: https://guidelight.ai/blog/control-assessment-august-2026

Article suivant

OpenAI veut détecter les abus sans jamais voir vos données

OpenAI a présenté en avant-première Private Safety Processing, un système destiné à détecter les modèles d'abus dans plusieurs conversations tout en conservant zéro rétention de données pour les clients professionnels. Anthropic nécessite toujours 30 jours de journaux pour ses modèles les plus puissants.

Un bouclier de cadenas flottant au-dessus d'un nuage avec des lignes de flux de données qui s'estompent