CourionAI
DE
Newsletter
← Alle News
security 3 Min. Lesezeit

Ein Codierungsassistent lud still und leise ganze Projekte hoch, einschließlich des Git-Verlaufs

Entwickler fanden heraus, dass ZCode von Z.ai ganze lokale Arbeitsbereiche verpackt, verschlüsselt und beim Start an den Cloud-Speicher gesendet hat. Eine Installation erzeugte ein 313 MB großes Archiv und 564 Upload-Versuche. Z.ai entschuldigte sich und stellte dem Kunden Open Source zur Verfügung.

Ein offener Koffer, aus dem ein langes Aktenband herausströmt und in eine Wolke hinauffließt

Ein Entwickler namens Ferstar zerlegte ZCode, den Codierungsassistenten des chinesischen Labors Z.ai, und stellte fest, dass er etwas tat, dem niemand zugestimmt hatte. Bei der Anmeldung packte die App den gesamten Arbeitsordner des Benutzers, einschließlich des vollständigen .git-Verlaufs, des Caches für große Dateien, Reflogs und globaler Anwendungseinstellungen, verschlüsselte das Paket und lud es in den Alibaba-Cloudspeicher hoch. Die untersuchte Installation erzeugte ein 313 MB großes Archiv mit 42.411 Dateien, von denen Git-Objekte 86,6 Prozent ausmachten, und protokollierte 564 fehlgeschlagene Versuche, es hochzuladen. Die Funktion war standardmäßig aktiviert und es gab keine Möglichkeit, sie auszuschalten.

Die Verschlüsselung ist der Teil, den Sicherheitsleute am unangenehmsten finden. Der passende private Schlüssel befindet sich nur in der Cloud von Z.ai, sodass der 313 MB große Blob auf der eigenen Festplatte des Benutzers weder vom Benutzer noch vom ZCode-Client selbst geöffnet werden kann. Wenn Sie wissen möchten, was Ihre Maschine zurückgelassen hat, müssen Sie bei der Firma nachfragen, die sie mitgenommen hat. Z.ai führte das Verhalten auf eine standardmäßig aktivierte „Codebase-Indexierung“-Funktion zurück, entschuldigte sich, sagte, es habe das Zustimmungsproblem behoben und gab an, dass hochgeladene Daten vernichtet worden seien. Am Montag ging es noch einen Schritt weiter und veröffentlichte den Desktop-, Web- und Befehlszeilencode von ZCode unter der Apache 2.0-Lizenz, damit Entwickler den Client selbst prüfen können.

Was steckt dahinter

Das Indizieren Ihres Codes ist für einen Assistenten eine wirklich nützliche Aufgabe. Wenn ein Tool Ihr Projekt gelesen hat, kann es Fragen zu Ihrem Projekt und nicht zur Programmierung im Allgemeinen beantworten, und jeder ernsthafte Coding-Assistent erledigt eine Version davon. Der Fehler lag hier nicht an der Idee, sondern an drei übereinander gestapelten Optionen: keine Einwilligungsaufforderung, kein Ausschalter und ein weitaus größerer Umfang, als der Job erforderte. Der Git-Verlauf ist kein Quellcode, an dem Sie gerade arbeiten. Dabei handelt es sich um jede Änderung, die jemals jemand vorgenommen hat, oft auch um Geheimnisse, die vor Jahren versehentlich begangen und aus den aktuellen Dateien, aber nie aus der Historie entfernt wurden. Das ist genau das Material, das Sie am wenigsten überraschend an Dritte weitergeben möchten.

Das Open-Sourcing des Clients ist eine echte und auch begrenzte Abhilfe. Damit kann von nun an jeder überprüfen, was das Programm sendet. Es kann nicht überprüft werden, was ein Server bereits empfangen hat oder ob er gelöscht wurde, weshalb die Aussage des Unternehmens der einzige Beweis in diesem Punkt bleibt.

Was das für Sie bedeutet: Wenn Sie ein kostenloses oder kostenpflichtiges KI-Codierungstool verwenden, lohnt es sich noch heute, es zu tun: Finden Sie dessen Einstellungen und suchen Sie nach Dingen, die als Indizierung, Workspace-Synchronisierung oder Telemetrie beschrieben werden, und entscheiden Sie sich bewusst und nicht standardmäßig. Behandeln Sie den Git-Verlauf als sensibel, denn das ist er auch. Und wenn ein Tool keine Möglichkeit bietet, eine Datenfunktion zu deaktivieren, ist dieses Fehlen selbst die Antwort auf die Denkweise des Anbieters. Dabei handelt es sich nicht um ein China-spezifisches Problem, sondern um ein Problem mit Standardeinstellungen, und es lohnt sich, die gleiche Prüfung auf Tools von überall aus durchzuführen.

Quellen

Quellen: https://www.tomshardware.com/tech-industry/artificial-intelligence/devs-say-chinese-ai-company-silently-uploaded-hundreds-of-megabytes-of-local-workspace-data-z-ai-the-firm-behind-the-glm-models-didnt-ask-for-user-consent-and-made-564-attempts-to-exfiltrate-313mb-archive

Nächster Artikel

Die Testlast von Anthropic ist in sechs Monaten um das 25-fache gestiegen, weil Claude den Code schreibt

Anthropic veröffentlichte interne Zahlen darüber, welche Auswirkungen die Agentencodierung auf die eigene Technik hatte: achtmal mehr Code pro Quartal, zehnmal mehr Tests und ein automatisiertes Prüfsystem, das neu aufgebaut werden musste, nachdem drei Patches fehlgeschlagen waren.

Ein Förderband, das unter einem viel zu hoch gestapelten Stapel identischer Kisten durchhängt