CourionAI
DE
Newsletter
← Alle News
anthropic 3 Min. Lesezeit

Die Testlast von Anthropic ist in sechs Monaten um das 25-fache gestiegen, weil Claude den Code schreibt

Anthropic veröffentlichte interne Zahlen darüber, welche Auswirkungen die Agentencodierung auf die eigene Technik hatte: achtmal mehr Code pro Quartal, zehnmal mehr Tests und ein automatisiertes Prüfsystem, das neu aufgebaut werden musste, nachdem drei Patches fehlgeschlagen waren.

Ein Förderband, das unter einem viel zu hoch gestapelten Stapel identischer Kisten durchhängt

Anthropic veröffentlichte diese Woche eine seltene Reihe interner Zahlen darüber, was mit seiner eigenen Entwicklungsabteilung geschah, nachdem Codierungsagenten den größten Teil des Schreibens übernommen hatten. Innerhalb von sechs Monaten stieg das Volumen der automatisierten Prüfaufträge um das 25-fache. Ingenieure lieferten pro Quartal etwa achtmal so viel Code aus wie in den Jahren 2021 bis 2025, wobei Claude etwa 80 Prozent davon schrieb, und die Anzahl der Tests in der Codebasis verzehnfachte sich. Die Zahl der Ingenieure hat sich kaum verändert.

Der dadurch entstandene Engpass ist verständlich, auch wenn Sie nie Software schreiben. Kontinuierliche Integration, meist mit CI abgekürzt, ist die automatische Überprüfung, die jedes Mal ausgeführt wird, wenn jemand den Code ändert: Das Projekt wird neu erstellt und die Tests ausgeführt, um festzustellen, ob die Änderung etwas kaputt gemacht hat. Wenn eine Codebasis größer wird, wird die Ausführung jedes Tests für jede Änderung zu langsam. Daher verwenden Teams die Testauswirkungsanalyse, einen Dienst, der ermittelt, welche Tests eine bestimmte Änderung tatsächlich beeinflussen könnte, und nur diese ausführt. Dieser Service hat es kaputt gemacht. Die Ingenieure von Anthropic haben es dreimal gepatcht und berichtet, dass die Korrekturen 70 Tage, dann 29 Tage und dann weniger als einen Tag hielten, bevor sie das Patchen aufgaben und es neu gestalteten. „Das Schreiben von Code ist nicht länger die Einschränkung, und sobald die PR-Überprüfung beschleunigt wird, beginnt CI den Druck zu spüren“, schrieb Ingenieur Sachin Malhotra. Sein Rat an andere Teams war, davon auszugehen, dass ihre Systeme innerhalb von zwei Quartalen dem 25-fachen ihrer aktuellen Belastung ausgesetzt sein werden, und für das Zehn- bis Zwanzigfache dessen aufzubauen, was notwendig erscheint.

Was steckt dahinter

Dies ist das bisher klarste veröffentlichte Beispiel für ein Muster, das es wert ist, genannt zu werden: Die Automatisierung eines Schritts beseitigt den Engpass nicht, sondern verschiebt ihn nach unten. Der Code war der langsame Teil, also wurde er automatisiert, und jetzt überprüfen die langsamen Teile den Code und beweisen, dass er funktioniert. Beachten Sie, dass sich auch die Anzahl der Tests verzehnfachte, was bedeutet, dass die Verifizierungsarbeit nicht kleiner wurde, als die Schreibgeschwindigkeit zunahm. Es ist damit gewachsen. Ein fairer Vorbehalt: Hierbei handelt es sich um selbst gemeldete Zahlen eines Unternehmens, das den betreffenden Codierungsagenten verkauft und in seinem eigenen Blog veröffentlicht wurde. „Claude hat 80 Prozent des Codes geschrieben“ ist eine Kennzahl, deren Definition Anthropic kontrolliert. Die Betriebsdetails, drei fehlgeschlagene Patches und ein Neuaufbau, sind eher als echte Technik denn als Marketing zu verstehen, was den Beitrag interessant macht.

Was das für Sie bedeutet: Wenn Sie an einem Ort arbeiten, an dem KI-Tools eingeführt werden, ist dies die Frage, die Sie in die Besprechung einbringen sollten: Wenn dieser Schritt schneller wird, was ist der nächste Schritt, und kann er das Volumen aushalten? Die Antwort ist normalerweise ein Überprüfungsprozess, eine Genehmigungswarteschlange oder ein überlasteter Kollege, und diese lassen sich nicht durch den Kauf weiterer Computer skalieren. Wenn Sie Software schreiben, besteht die praktische Variante darin, einen Blick auf Ihre Prüfpipeline zu werfen, bevor sich Ihr Team stärker auf Agenten verlässt, da eine Pipeline, die heute komfortabel ist, bei fünffachem Volumen ausfallen kann. Und wenn Sie einfach nur neugierig sind, wie viel KI in einem Grenzlabor tatsächlich Produktionscode schreibt, ist dies eine echte Zahl von innen, mit der entsprechenden Prise Salz.

Quellen

Quellen: https://claude.com/blog/agentic-coding-is-straining-ci-heres-how-we-scaled-test-impact-analysis-at-anthropic

Nächster Artikel

Claude Codes „dauerhafter Anstieg um 25 %“ ist tatsächlich 17 % weniger als letzte Woche

Die neuen wöchentlichen Limits von Anthropic für Claude Code traten am 14. September in Kraft. Sie liegen über dem Basiswert im Frühjahr und unter dem, was die Nutzer tatsächlich hatten, da am Vortag ein vorübergehender Anstieg abgelaufen ist.

Eine Sanduhr, deren obere Kammer schmaler ist als die untere, neben einem Messbecher