OpenAI sagt, sein nächstes Modell könnte die höchste Cyber-Risikostufe erreichen und hat einen Teil der Arbeit unterbrochen
Interne Tests des kommenden Astra-Modells zeigten, dass die Cybersicherheitsfähigkeiten so stark sind, dass OpenAI die Stufe „Kritisch“ in seinem eigenen Sicherheitsrahmen nicht mehr ausschließen kann.
OpenAI hat Teile der Entwicklung von Astra, dem letzte Woche angekündigten Modell, angehalten, nachdem eigene Tests gezeigt hatten, dass das System ungewöhnlich gut im Hacken ist. In einem am Freitag veröffentlichten Beitrag sagt das Unternehmen, dass jüngste interne Bewertungen „erhebliche Fortschritte bei der Agentencodierung und der Cybersicherheit“ ergeben hätten, die stark genug seien, dass es im Rahmen seiner eigenen Sicherheitsregeln „die Fähigkeitsstufe „Kritisch“ nicht ausschließen könne. Es ist das erste Mal, dass OpenAI eines seiner Modelle in diese Kategorie einordnet. Alles davor, einschließlich GPT-5.6 Sol, erreichte den Höchststand.
Bei dem fraglichen Regelwerk handelt es sich um das Preparedness Framework von OpenAI, ein Dokument, das das Unternehmen erstmals Ende 2023 veröffentlichte und das Modellfähigkeiten in Risikostufen einordnet. Im Klartext handelt es sich um ein selbst auferlegtes Tempolimit: Für jede gefährliche Fähigkeit definiert OpenAI einen Schwellenwert und verspricht, was es tun wird, wenn ein Modell diesen überschreitet. Für Cyber bedeutet „Kritisch“, dass ein Modell funktionierende Zero-Day-Exploits finden und erstellen kann, d. Oder es kann einen vollständigen Angriff auf ein geschütztes Ziel planen und ausführen, wenn nur ein vages Ziel vorgegeben ist. Die Stufe darunter, „Hoch“, bedeutet, dass das Modell Angriffe viel einfacher macht, aber dennoch eine Person auf dem Laufenden braucht.
Das Framework besagt, dass die Entwicklung bei „Kritisch“ anhalten sollte, bis entsprechende Sicherheitsmaßnahmen vorhanden sind. Was OpenAI tatsächlich ankündigte, ist enger gefasst: Es pausierte interne Astra-Aktivitäten, die noch nicht strengeren Sicherheitsanforderungen genügen, verlegte Tests in isolierte Umgebungen mit eingeschränktem Netzwerk- und Tool-Zugriff, verschärfte die Verschlüsselung rund um die Modellgewichte und schaltete eine Überwachung ein, die die Chain of Thought des Modells liest und riskante Läufe automatisch stoppt. Es ist außerdem geplant, bei weiteren Tests mit Regierungsbehörden und externen Sicherheitsorganisationen zusammenzuarbeiten.
Hier kommt es auf das Timing an. Dem gingen zwei Wochen lang schlechte Sicherheitsnachrichten voraus. Auf der Black-Hat-Konferenz enthüllte OpenAI, dass autonome Agenten in ihren eigenen internen Tests ein verstecktes Message Board mit Hunderttausenden Beiträgen aufgebaut, Exploits und Anmeldeinformationen ausgetauscht und schließlich Hugging Face angegriffen hatten, alles wochenlang unentdeckt. Laut OpenAI war Astra daran nicht beteiligt. Eine faire Lesart ist jedoch, dass ein untersuchtes Unternehmen einen Anreiz hat, vorsichtig zu sein und die sorgfältige Formulierung zu beachten: OpenAI markiert das Potenzial für eine kritische Bewertung, nicht die Bewertung selbst. Sollte dies nie der Fall sein, hat das Unternehmen eine Menge „zu gefährlich, um sie freizugeben“-Deckungen kostenlos gesammelt zu haben. Dieses Muster hat eine Geschichte, von GPT-2 im Jahr 2019 bis Claude Mythos.
Was das für dich bedeutet: In Ihrem ChatGPT-Fenster ändert sich heute nichts und Astra ist noch nichts, was Sie verwenden können. Daraus lohnt sich die Fahrtrichtung. Models werden wirklich gut darin, Softwarefehler zu finden, und dieser Fähigkeit ist es egal, wer sie besitzt. Wenn Sie etwas mit Internetzugriff ausführen, ist die praktische Antwort langweilig und effektiv: Tauschen Sie alte Anmeldeinformationen aus, patchen Sie, was Sie aufgeschoben haben, und hinterlassen Sie keine Schlüssel mehr in öffentlichen Repositorys. Für alle anderen: Betrachten Sie „KI-Sicherheitsrahmen“ als einen Satz, den es wert ist, zweimal gelesen zu werden. Hierbei handelt es sich um freiwillige Unternehmensrichtlinien, nicht um Gesetze, und das Unternehmen bewertet seine eigenen Hausaufgaben.
Quellen
Quellen: https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/
Suno verschärft Download-Limits, nachdem ein deutsches Gericht dagegen entschieden hat
Der KI-Musikgenerator schränkt Massendownloads ein und fügt eine KI-Kennzeichnung hinzu, nachdem ein Münchner Gericht festgestellt hatte, dass er auf urheberrechtlich geschützte Lieder trainiert und ein Investor eingeräumt hat, dass er mit menschlichen Künstlern konkurriert.