La charge de test d'Anthropic a augmenté de 25 fois en six mois parce que Claude écrit le code
Anthropic a publié des chiffres internes sur les effets du codage agent sur sa propre ingénierie : huit fois plus de code par trimestre, dix fois plus de tests et un système de vérification automatisé qui a dû être reconstruit après l'échec de trois correctifs.
Anthropic a publié cette semaine une rare série de chiffres internes sur ce qui est arrivé à son propre service d’ingénierie une fois que les agents de codage ont pris en charge la majeure partie de la saisie. En six mois, le volume des tâches de contrôle automatisé a été multiplié par 25. Les ingénieurs ont expédié environ huit fois plus de code par trimestre qu’au cours des années 2021 à 2025, Claude en écrivant environ 80 %, et le nombre de tests dans la base de code a été multiplié par dix. Les effectifs ingénieurs ont à peine bougé.
Le goulot d’étranglement que cela a créé mérite d’être compris même si vous n’écrivez jamais de logiciel. L’intégration continue, généralement abrégée en CI, est la vérification automatique qui s’exécute chaque fois que quelqu’un modifie le code : elle reconstruit le projet et exécute les tests pour voir si la modification a cassé quelque chose. Lorsqu’une base de code devient volumineuse, l’exécution de chaque test sur chaque modification devient trop lente. Les équipes utilisent donc l’analyse d’impact des tests, un service qui détermine quels tests une modification donnée pourrait réellement affecter et exécute uniquement ceux-ci. C’est ce service qui s’est effondré. Les ingénieurs d’Anthropic l’ont corrigé trois fois et ont signalé que les correctifs ont tenu pendant 70 jours, puis 29 jours, puis moins d’un jour, avant d’abandonner les correctifs et de le repenser. “L’écriture de code n’est plus une contrainte, et une fois que l’examen des relations publiques s’accélère, CI commence à ressentir la pression”, a écrit l’ingénieur Sachin Malhotra. Son conseil aux autres équipes était de supposer que leurs systèmes seraient confrontés à 25 fois leur charge actuelle d’ici deux trimestres, et de construire dix à vingt fois ce qui semble nécessaire.
Qu’est-ce qu’il y a derrière ça
Il s’agit de l’exemple publié le plus clair jusqu’à présent d’un modèle qui mérite d’être mentionné : l’automatisation d’une étape ne supprime pas le goulot d’étranglement, elle le déplace en aval. Le code était la partie lente, il a donc été automatisé, et maintenant les parties lentes examinent le code et prouvent qu’il fonctionne. Notez que les tests ont également été multipliés par dix, ce qui signifie que le travail de vérification n’a pas diminué lorsque l’écriture s’est accélérée. Cela a grandi avec cela. Une mise en garde juste : il s’agit de chiffres auto-déclarés par une société qui vend l’agent de codage en question, publiés sur son propre blog, et “Claude a écrit 80 % du code” est une mesure dont la définition est contrôlée par Anthropic. Les détails opérationnels, trois correctifs échoués et une reconstruction, se lisent comme une véritable ingénierie plutôt que comme du marketing, ce qui rend le message intéressant.
Ce que cela signifie pour vous : Si vous travaillez dans un endroit où des outils d’IA sont introduits, voici la question à poser lors de la réunion : une fois que cette étape s’accélère, quelle est la prochaine étape et peut-elle prendre du volume ? La réponse est généralement un processus de révision, une file d’attente d’approbation ou un collègue surchargé, et ceux-ci ne peuvent pas évoluer en achetant davantage d’ordinateurs. Si vous écrivez un logiciel, la version pratique consiste à examiner votre pipeline de vérification avant que votre équipe ne s’appuie davantage sur les agents, car un pipeline qui est confortable aujourd’hui peut s’effondrer avec un volume cinq fois supérieur. Et si vous êtes simplement curieux de savoir dans quelle mesure l’IA écrit réellement du code de production dans un laboratoire frontalier, il s’agit d’un chiffre réel venant de l’intérieur, proposé avec la pincée de sel appropriée.
Sources
L'« augmentation permanente de 25 % » de Claude Code est en réalité 17 % de moins que la semaine dernière
Les nouvelles limites hebdomadaires d'Anthropic pour Claude Code sont entrées en vigueur le 14 septembre. Ils sont supérieurs à la référence du printemps et inférieurs à ce que les utilisateurs avaient réellement, car un boost temporaire a expiré la veille.