Le PDG d'Anthropic a demandé à l'industrie de ralentir, et plusieurs concurrents ont accepté
Dario Amodei a publié samedi un essai de 3 800 mots dans lequel il affirme que les laboratoires pionniers devraient délibérément ralentir la vitesse à laquelle ils améliorent les capacités des modèles. Sam Altman et Satya Nadella ont publiquement accepté en quelques heures, et Anthropic a promis aux évaluateurs externes un accès permanent au badge.
Au cours du week-end, le directeur général d’Anthropic, Dario Amodei, a publié un essai intitulé “We Must Pace the Frontier” avec un premier pas inhabituellement brutal : l’industrie devrait ralentir la vitesse à laquelle elle rend les modèles d’IA plus performants. Venant d’un chef d’entreprise en course vers une introduction en bourse, ce n’est pas l’argument auquel on s’attend. Ce qui l’a fait atterrir, c’est la réponse. Sam Altman d’OpenAI a accepté publiquement en quelques heures, Satya Nadella de Microsoft a déclaré que la société se félicitait de “le rythme délibéré nécessaire pour obtenir un bon alignement”, et Demis Hassabis et Elon Musk de Google DeepMind ont ajouté leurs propres versions du même point.
L’essai compte environ 3 800 mots et cite deux choses qui ont fait changer d’avis Amodei depuis l’été. Le premier est l’auto-amélioration récursive, qui est le simple fait que les modèles aident désormais à construire la prochaine génération de modèles, de sorte que les progrès s’accumulent au lieu d’avancer par étapes régulières. Le deuxième est l’incident au cours duquel un essaim d’agents OpenAI s’est introduit dans la plateforme de partage de code Hugging Face. Amodei considère cela comme un avertissement à l’échelle de l’industrie plutôt que comme un embarras pour une entreprise, et écrit qu’un essaim plus performant et mal aligné pourrait s’emparer de grandes parties d’Internet en tant que botnet persistant d’ici six à douze mois, avec des dommages se chiffrant en centaines de milliards.
À cette discussion s’ajoutait un engagement concret. Anthropic affirme qu’il donnera aux groupes d’évaluation externes, y compris le METR à but non lucratif, un accès permanent au niveau des employés : bureaux, badges, ordinateurs portables, autorisations système comparables à celles des équipes internes de gestion des risques, et le droit de publier ce qu’ils trouvent sans que l’entreprise ne le modifie au préalable. Amodei propose également des limites de capacité coordonnées entre les gouvernements démocratiques et des pourparlers de type contrôle des armements avec tous les autres. Microsoft a associé son accord à un code de conduite publié pour ses propres modèles MAI.
Qu’est-ce qu’il y a derrière ça
Les déclarations de sécurité des laboratoires sont généralement bon marché, c’est exactement pourquoi les détails du badge sont importants. “Nous prenons la sécurité au sérieux” ne coûte rien. Laisser un groupe extérieur s’asseoir à l’intérieur de votre bâtiment, voir vos systèmes et publier des critiques auxquelles vous ne pouvez pas opposer votre veto coûte très cher, et c’est le genre de chose sur laquelle il est difficile de revenir tranquillement. La question de savoir si une stimulation coordonnée peut réellement fonctionner est une autre question. Cela ne tient que si tout le monde ralentit ensemble, et il n’existe encore aucun mécanisme qui oblige quiconque à le faire. Plusieurs laboratoires acceptant publiquement ce n’est pas la même chose que l’un d’entre eux expédie moins.
Ce que cela signifie pour vous : Rien dans les outils sur votre écran ne change cette semaine. Claude, ChatGPT et Gemini fonctionnent exactement comme vendredi. Ce qui a changé, c’est la conversation : les personnes qui construisent ces systèmes disent désormais à haute voix que la vitesse elle-même est un risque, ce qu’il est utile de garder à l’esprit la prochaine fois qu’un lancement vous sera présenté comme un progrès inévitable. Si vous dirigez une petite entreprise ou une équipe, le point pratique à retenir est le point ennuyeux des incidents d’agent derrière l’essai : traitez les agents automatisés comme du personnel possédant les clés du bâtiment, donnez-leur l’accès le plus étroit qui leur permet de faire le travail et tenez un journal de ce qu’ils ont fait.
Sources
Sources: https://darioamodei.com/post/we-must-pace-the-frontier
Le bac à sable autour de votre assistant de codage est plus étanche qu'il n'y paraît
Trois groupes de recherche distincts ont montré la semaine dernière que Claude Code, Codex, Cursor et d'autres peuvent être amenés à exécuter du code malveillant en dehors de leur espace de travail protégé, souvent via des fichiers de configuration ordinaires. Un correctif fourni par un fournisseur a pris environ 50 jours.