CourionAI
FR
Newsletter
← Toutes les actus
agents 3 min de lecture

Même modèle, quatre outils différents, trois fois le prix : test de ce que vous coûte l'emballage

Composio a exécuté DeepSeek V4 Flash via Claude Code, Codex, OpenCode et Oh My Pi sur 30 tâches réelles. Les taux de réussite étaient similaires. Le coût variait de près de 3 fois et la vitesse de 2,2 fois, en fonction uniquement de l'outil qui exécutait le modèle.

Quatre moteurs identiques montés dans quatre cadres de formes différentes sur un établi, chacun avec son propre chronomètre et une pile de pièces de hauteur différente

Voici un résultat à connaître avant de choisir un outil de codage d’IA. La société d’outils d’IA Composio a pris un modèle unique, DeepSeek V4 Flash, et l’a exécuté via quatre frameworks d’agents différents sur les mêmes 30 tâches, en utilisant de vrais services comme Gmail, GitHub, Slack et Notion. A chaque fois le même modèle. Seul le logiciel qui l’entoure a changé.

Les taux de réussite étaient proches. Oh My Pi a terminé le plus de tâches à 17 sur 30, Claude Code et Codex se trouvaient juste derrière, et OpenCode était légèrement en retard à 14 sur 30. Sept des 30 tâches ont réussi ou échoué uniquement en raison du framework qui les a exécutées, ce qui est en soi un petit avertissement sur la répétabilité de tout cela.

Les lacunes qui comptaient réellement étaient le coût et le temps. OpenCode était le moins cher, à 0,073 dollars par tâche réussie. Claude Code était le plus cher à 0,195 dollar, soit près de trois fois plus, et pourtant il était aussi le plus rapide avec 122 secondes par tâche, contre 272 secondes pour le plus lent, Oh My Pi. Claude Code y est parvenu en utilisant le moins d’appels d’outils et en générant le moins de texte de sortie, ce qui illustre bien que « efficace » et « bon marché » ne sont pas le même mot.

Que se passe-t-il réellement ici

Une structure d’agent, parfois appelée harness, constitue la couche entre vous et le modèle. Il décide de la manière dont votre demande est formulée, de la part de l’historique de la conversation qui est renvoyée à chaque étape, du moment où appeler un outil externe, du nombre de nouvelles tentatives et du moment où s’arrêter. Le modèle réfléchit, mais le cadre décide combien de fois le modèle doit réfléchir et combien il doit lire à chaque fois. Puisque vous payez par unité de texte traitée, cette comptabilité représente l’essentiel de votre facture.

C’est pourquoi comparer des modèles dans un classement ne vous raconte qu’une partie de l’histoire. Un score de référence décrit un modèle dans une configuration spécifique. Votre coût et votre vitesse réels dépendent tout autant de l’outil dans lequel vous l’exécutez, et ces chiffres évoluent par multiples et non par pourcentages.

Quelques mises en garde justes. Trente tâches constituent un petit échantillon, le test a utilisé un modèle et des taux de réussite compris entre 14 et 17 signifient qu’environ la moitié de tout a échoué, quel que soit l’outil. Composio vend des outils dans cet espace, alors lisez-le comme un point de données utile plutôt que comme un verdict neutre. Et les quatre cadres sont des objectifs mobiles qui auront changé d’ici le mois prochain.

Ce que cela signifie pour vous: si vous utilisez un agent IA pour quelque chose de répétitif, l’outil est une véritable variable, pas un détail. Exécutez une poignée de vos propres tâches typiques via deux options et comparez la facture et l’horloge murale, car la différence est suffisamment grande pour être remarquée. Si vous débutez, ne vous inquiétez pas du choix, mais activez l’affichage quel que soit le prix proposé par votre outil. L’habitude la plus utile ici est de savoir combien vous coûte une tâche avant de l’exécuter cent fois.

Sources

-Claude Code est le framework d’agent le plus rapide mais coûte près de trois fois plus cher, The Decoder

Sources: https://the-decoder.com/claude-code-is-the-fastest-agent-framework-but-costs-nearly-three-times-more-than-the-cheapest-rival/

Article suivant

Anthropic desserre le filtre biologique de Claude Fable 5, réduisant les questions bloquées de 85 %

Fable 5 a été lancé avec presque toutes les questions de biologie bloquées. Un classificateur de sécurité recyclé permet désormais de répondre aux questions quotidiennes de santé et d'étude, réduisant ainsi les échecs liés à la biologie d'environ 85 pour cent. La virologie professionnelle et la conception de médicaments restent bloquées.

Un tamis à mailles fines au-dessus d'une rangée de flacons de laboratoire et de boîtes de Pétri, une petite porte s'ouvrant de sorte que quelques formes de molécules dérivent à travers tandis que les autres sont retenues.