Der CEO von Anthropic forderte die Branche auf, langsamer zu werden, und mehrere Konkurrenten stimmten zu
Dario Amodei veröffentlichte am Samstag einen Aufsatz mit 3.800 Wörtern, in dem er argumentierte, dass Grenzlabore die Geschwindigkeit, mit der sie die Modellfähigkeiten verbessern, bewusst verlangsamen sollten. Sam Altman und Satya Nadella stimmten innerhalb weniger Stunden öffentlich zu, und Anthropic versprach externen Gutachtern dauerhaften Zugang zu den Badges.
Am Wochenende veröffentlichte Anthropic-Chef Dario Amodei einen Aufsatz mit dem Titel „We Must Pace the Frontier“ mit einem ungewöhnlich klaren ersten Schritt: Die Branche sollte die Geschwindigkeit drosseln, mit der sie KI-Modelle leistungsfähiger macht. Wenn man vom Chef eines Unternehmens spricht, das auf dem Weg zu einem Börsengang ist, ist das nicht das Argument, das man erwartet. Der Grund dafür, dass es landete, war die Reaktion. Sam Altman von OpenAI stimmte innerhalb weniger Stunden öffentlich zu, Satya Nadella von Microsoft sagte, das Unternehmen begrüße „das bewusste Tempo, das für die richtige Ausrichtung erforderlich ist“, und Demis Hassabis und Elon Musk von Google DeepMind fügten ihre eigenen Versionen des gleichen Punkts hinzu.
Der Aufsatz umfasst etwa 3.800 Wörter und nennt zwei Dinge, die Amodeis Meinung seit dem Sommer geändert haben. Die erste ist die rekursive Selbstverbesserung, bei der es sich schlicht um die Tatsache handelt, dass Modelle jetzt beim Aufbau der nächsten Modellgeneration helfen, sodass der Fortschritt gestaffelt statt in stetigen Schritten voranschreitet. Der zweite ist der Vorfall, bei dem ein Schwarm von OpenAI-Agenten in die Code-Sharing-Plattform Hugging Face einbrach. Amodei betrachtet dies als eine branchenweite Warnung und nicht als eine Peinlichkeit eines einzelnen Unternehmens und schreibt, dass ein leistungsfähigerer, schlecht ausgerichteter Schwarm innerhalb von sechs bis zwölf Monaten als persistentes Botnetz weite Teile des Internets übernehmen könnte, mit Schäden in Hunderten von Milliarden.
Mit der Argumentation ging eine konkrete Zusage einher. Anthropic sagt, dass es externen Bewertungsgruppen, einschließlich der gemeinnützigen METR, dauerhaften Zugriff etwa auf Mitarbeiterebene gewähren wird: Schreibtische, Ausweise, Laptops, Systemberechtigungen vergleichbar mit internen Risikoteams und das Recht, das Gefundene zu veröffentlichen, ohne dass das Unternehmen es vorher bearbeitet. Amodei schlägt außerdem koordinierte Fähigkeitsgrenzen zwischen demokratischen Regierungen und Gespräche im Stil einer Rüstungskontrolle mit allen anderen vor. Microsoft hat seine Vereinbarung mit einem veröffentlichten Verhaltenskodex für seine eigenen MAI-Modelle gepaart.
Was steckt dahinter
Sicherheitserklärungen von Laboren sind in der Regel günstig, weshalb die Details des Abzeichens wichtig sind. „Wir nehmen Sicherheit ernst“ kostet nichts. Eine externe Gruppe in Ihrem Gebäude sitzen zu lassen, Ihre Systeme zu sehen und Kritik zu veröffentlichen, gegen die Sie kein Veto einlegen können, kostet ziemlich viel, und so etwas kann man nur schwer stillschweigend zurücknehmen. Ob eine koordinierte Taktung tatsächlich funktionieren kann, ist eine andere Frage. Es gilt nur, wenn alle gemeinsam langsamer werden, und es gibt noch keinen Mechanismus, der irgendjemanden dazu zwingt. Wenn sich mehrere Labore öffentlich einigen, bedeutet das nicht, dass sie weniger liefern.
Was das für Sie bedeutet: An den Tools auf Ihrem Bildschirm ändert sich diese Woche nichts. Claude, ChatGPT und Gemini funktionieren genauso wie am Freitag. Was sich geändert hat, ist die Diskussion: Die Leute, die diese Systeme bauen, sagen jetzt laut, dass die Geschwindigkeit selbst das Risiko darstellt, was nützlich ist, wenn man es im Hinterkopf behält, wenn einem das nächste Mal ein Start als unvermeidlicher Fortschritt verkauft wird. Wenn Sie ein kleines Unternehmen oder ein Team leiten, ist die praktische Erkenntnis die langweilige aus den Agentenvorfällen hinter dem Aufsatz: Behandeln Sie automatisierte Agenten wie Mitarbeiter mit Schlüsseln zum Gebäude, gewähren Sie ihnen den engsten Zugang, der ihnen die Arbeit ermöglicht, und führen Sie ein Protokoll darüber, was sie getan haben.
Quellen
Quellen: https://darioamodei.com/post/we-must-pace-the-frontier
Die Sandbox rund um Ihren Codierungsassistenten ist undichter als es aussieht
Drei verschiedene Forschungsgruppen haben letzte Woche gezeigt, dass Claude Code, Codex, Cursor und andere dazu gebracht werden können, Angreifercode außerhalb ihres geschützten Arbeitsbereichs auszuführen, oft über gewöhnliche Konfigurationsdateien. Eine Reparatur durch einen Anbieter dauerte etwa 50 Tage.