CourionAI
FR
Newsletter
← Toutes les actus
open-weight 3 min de lecture

Ce modèle ouvert est si efficace pour trouver des bugs que son propre créateur ne le publiera pas encore

Le GLM-5.3 de Z.ai a détecté 2 436 vulnérabilités dans 269 projets open source lors des tests. La société retient les poids téléchargeables pendant environ deux semaines le temps de durcir le modèle, un délai inhabituel pour une version à poids ouvert.

Un livre de code ouvert avec une loupe trouvant une icône de bug devant un bouclier

Le laboratoire chinois d’IA Z.ai a publié son nouveau modèle de codage, GLM-5.3, le 14 août, mais il y a un hic : vous ne pouvez pas encore le télécharger. Normalement, un modèle « à poids ouvert » signifie que l’entreprise publie les fichiers de modèle réels afin que chacun puisse en exécuter une copie sur son propre matériel. Z.ai a plutôt lancé GLM-5.3 via son service de codage hébergé et a déclaré qu’il conserverait les poids téléchargeables pendant environ deux semaines le temps de terminer les tests de sécurité.

La raison est ce que les tests ont révélé. Sur CyberGym, un benchmark qui mesure dans quelle mesure un modèle trouve de réelles vulnérabilités dans les logiciels existants, GLM-5.3 a obtenu un score de 84,5 %, contre 77,2 % pour son prédécesseur. Z.ai a créé un « registre de sécurité » public répertoriant les résultats du modèle : dès la semaine du lancement, 2 436 problèmes signalés dans 269 projets open source, dont plus d’un millier ont été jugés critiques ou de gravité élevée. À ce stade, seuls 53 d’entre eux disposaient de correctifs publics (CVE, les numéros de suivi standard des failles logicielles connues) ; les autres étaient toujours sous embargo pendant que les responsables des projets concernés travaillaient sur des correctifs.

Que se passe-t-il réellement : GLM-5.3 n’a pas reçu de nouveau cerveau, pour ainsi dire. Z.ai dit qu’il s’agit du même modèle de base que GLM-5.2, avec juste une formation supplémentaire sur le codage long et les tâches “agentiques”, ce qui signifie que le modèle s’est entraîné à exécuter du code, à le tester et à corriger ses propres erreurs en boucle, plutôt que de simplement décrire ce que le code devrait faire. Ce type de formation s’avère très efficace pour détecter les bogues logiciels, presque comme un effet secondaire, car repérer une vulnérabilité et comprendre comment l’exploiter font appel à des compétences similaires. Il vaut la peine d’être clair sur ce que les chiffres font et ne montrent pas : ce sont les propres résultats de tests de Z.ai, non vérifiés de manière indépendante, et trouver un bug est une tâche différente et plus facile que de pénétrer de manière fiable dans un système actif.

Bien que les poids restent privés, Z.ai donne un accès contrôlé aux chercheurs en sécurité agréés et a publié un outil distinct appelé OpenVuln qui permet aux responsables open source d’analyser leurs propres référentiels avec le modèle, avant que toute personne mal intentionnée n’en ait la chance.

Ce que cela signifie pour vous : si vous ne travaillez pas avec une infrastructure open source, il s’agit principalement d’un signal indiquant la direction que prend la recherche sur la sécurité de l’IA, et non de quelque chose qui touche votre quotidien. Si vous maintenez ou comptez sur un logiciel open source, c’est un aperçu du compromis à venir pour tout le monde : une fois que les poids de GLM-5.3 sont publics, n’importe qui peut exécuter la même capacité de recherche de bogues localement, pour la défense ou pour l’attaque, et Z.ai a déjà déclaré qu’il ne pouvait pas contrôler ce qui se passerait après cela. Une mise en garde : deux semaines, ce n’est pas une longue période pour que des centaines de responsables corrigent plus d’un millier de failles avant que le filet de sécurité ne se détache.

##Sources

Sources: https://mlq.ai/news/zai-delays-glm-53-weights-after-cybersecurity-tests-show-strong-exploit-capability/

Article suivant

Les compétences améliorent les agents IA en leur fournissant une liste de contrôle et non des faits. Et ils arrêtent de travailler à 100 entrées

Princeton et l'UC San Diego ont effectué 8 135 tests contrôlés. La procédure expliquait 65,7 pour cent des gains, les connaissances seulement 4,5. L'augmentation de la bibliothèque de 5 à 100 compétences a fait chuter la précision de récupération de 29,6 à 3,3 pour cent.

Une liste de contrôle du presse-papiers avec des coches et un bras mécanique suivant les étapes