CourionAI
FR
Newsletter
← Toutes les actus
security 3 min de lecture

Un assistant de codage téléchargeait silencieusement des projets entiers, y compris l'historique Git

Les développeurs ont découvert que le ZCode de Z.ai regroupait des espaces de travail locaux entiers, les chiffrait et les envoyait vers le stockage cloud lors de leur lancement. Une installation a produit une archive de 313 Mo et 564 tentatives de téléchargement. Z.ai s'est excusé et a ouvert le client.

Une valise ouverte avec un long ruban de fichiers qui en sortent et remontent dans un nuage

Un développeur du nom de Ferstar a démonté ZCode, l’assistant de codage du laboratoire chinois Z.ai, et a découvert qu’il faisait quelque chose que personne n’avait accepté. Lors de la connexion, l’application a regroupé l’intégralité du dossier de travail de l’utilisateur, y compris l’historique complet .git, le cache de fichiers volumineux, les reflogs et les paramètres globaux de l’application, a chiffré l’ensemble et l’a téléchargé sur le stockage cloud d’Alibaba. L’installation examinée a produit une archive de 313 Mo couvrant 42 411 fichiers, dont 86,6 % d’objets Git, et a enregistré 564 tentatives infructueuses pour la faire remonter. La fonctionnalité était activée par défaut sans aucun moyen de la désactiver.

Le cryptage est la partie de la sécurité que les gens trouvent la plus inconfortable. La clé privée correspondante se trouve uniquement dans le cloud de Z.ai, de sorte que le blob de 313 Mo sur le propre disque de l’utilisateur ne peut pas être ouvert par l’utilisateur ou par le client ZCode lui-même. Si vous voulez savoir ce qui a laissé votre machine, vous devez demander à l’entreprise qui l’a récupérée. Z.ai a attribué ce comportement à une fonctionnalité « d’indexation de la base de code » activée par défaut, s’est excusé, a déclaré avoir résolu le problème de consentement et a déclaré que les données téléchargées avaient été détruites. Lundi, il est allé plus loin et a publié le code du bureau, du Web et de la ligne de commande de ZCode sous la licence Apache 2.0 afin que les développeurs puissent auditer le client par eux-mêmes.

Qu’est-ce qu’il y a derrière ça

Indexer votre code est une chose vraiment utile pour un assistant. Si un outil a lu votre projet, il peut répondre à des questions sur votre projet plutôt que sur la programmation en général, et tout assistant de codage sérieux en fait une version. L’échec ici n’était pas l’idée, mais plutôt trois choix empilés les uns sur les autres : pas de demande de consentement, pas d’interrupteur d’arrêt et une portée bien plus large que le travail requis. L’historique Git n’est pas le code source sur lequel vous travaillez actuellement. Il s’agit de tous les changements jamais apportés, y compris souvent des secrets commis par accident il y a des années et supprimés des fichiers actuels mais jamais de l’historique. C’est exactement le matériel que vous aimeriez le moins remettre par surprise à un tiers.

Open-sourcer le client est une véritable remédiation mais aussi limitée. Il permet à quiconque de vérifier ce que le programme envoie désormais. Il ne peut pas vérifier ce qu’un serveur a déjà reçu, ni s’il a été supprimé, c’est pourquoi la parole de l’entreprise reste la seule preuve sur ce point.

Ce que cela signifie pour vous : Cela vaut la peine d’être fait aujourd’hui si vous utilisez un outil de codage d’IA, gratuit ou payant : recherchez ses paramètres et recherchez tout ce qui est décrit comme indexation, synchronisation de l’espace de travail ou télémétrie, et décidez délibérément plutôt que par défaut. Traitez l’historique de Git comme sensible, car il l’est. Et si un outil n’offre aucun moyen de désactiver une fonctionnalité de données, cette absence est en soi la réponse à la façon de penser du fournisseur. Rien de tout cela n’est un problème spécifique à la Chine, il s’agit d’un problème de paramètres par défaut, et le même audit mérite d’être exécuté sur des outils de n’importe où.

Sources

Sources: https://www.tomshardware.com/tech-industry/artificial-intelligence/devs-say-chinese-ai-company-silently-uploaded-hundreds-of-megabytes-of-local-workspace-data-z-ai-the-firm-behind-the-glm-models-didnt-ask-for-user-consent-and-made-564-attempts-to-exfiltrate-313mb-archive

Article suivant

La charge de test d'Anthropic a augmenté de 25 fois en six mois parce que Claude écrit le code

Anthropic a publié des chiffres internes sur les effets du codage agent sur sa propre ingénierie : huit fois plus de code par trimestre, dix fois plus de tests et un système de vérification automatisé qui a dû être reconstruit après l'échec de trois correctifs.

Un tapis roulant affaissé sous une pile de caisses identiques empilées bien trop haut