Sakana affirme que son routeur surpasse désormais un modèle qu’il n’utilise même pas
Fugu Ultra v1.1 répartit chaque question entre plusieurs modèles de pointe au lieu de s’appuyer sur un seul. Sakana revendique un gain allant jusqu’à 7,9 points et une victoire sur Claude Fable 5. Personne ne l’a encore vérifié et l’Europe ne peut toujours pas l’utiliser.
La plupart des produits d’IA vous demandent de choisir un modèle. Fugu Ultra de Sakana AI pose une autre question : pourquoi n’en choisir qu’un ? Il s’agit d’un routeur, une couche placée devant plusieurs modèles de pointe qui décide lequel doit traiter une requête donnée et assemble les résultats. Sakana vient de publier la version 1.1, assortie d’une affirmation audacieuse. Selon l’entreprise, le routeur obtient jusqu’à 7,9 points de plus que la version 1.0, avec les plus fortes progressions en programmation et dans les tâches de terminal, et surpasse Claude Fable 5 d’Anthropic alors même que Fable 5 ne figure pas parmi les modèles auxquels il fait appel.
Cette affirmation mérite d’être considérée avec prudence. Tous les chiffres viennent de Sakana et aucun test indépendant n’existe encore. Les benchmarks publiés par l’entreprise qui a conçu le produit ouvrent une discussion, ils ne rendent pas un verdict. L’architecture est décrite dans un rapport technique sur arXiv si vous souhaitez examiner vous-même le raisonnement.
Les tarifs restent inchangés : 5 dollars par million de jetons en entrée et 30 dollars par million de jetons en sortie. Les jetons sont les petits fragments de texte qu’un modèle lit et écrit, et la facturation se fait à l’unité ; 30 dollars pour la sortie se situe donc dans le haut de la fourchette. Sakana indique qu’il faut environ deux semaines d’entraînement et d’évaluation avant d’ajouter au groupe un nouveau modèle de pointe, reconnaissant à demi-mot qu’un routeur reste toujours un peu en retard sur la frontière vers laquelle il achemine les requêtes. La mise à jour ajoute aussi un point d’accès compatible avec Claude Code, afin que les développeurs puissent appeler Fugu directement depuis le terminal. Le service reste disponible sur des plateformes comme OpenRouter et Vercel.
Le principe du routage est réellement intéressant. Les modèles excellent dans des domaines différents et leurs faiblesses ne se recouvrent pas parfaitement. Un système choisissant le bon modèle pour chaque tâche peut donc, en théorie, faire mieux que chacun pris séparément. C’est la promesse de « l’intelligence collective ». Le problème tient au coût et à la vitesse : la première version de Fugu avait suscité un accueil mitigé précisément parce que ses détracteurs estimaient qu’elle consommait beaucoup de jetons, fonctionnait lentement et n’apportait pas assez pour justifier l’un ou l’autre. La version 1.1 constitue la réponse de Sakana ; son succès dépendra de tests que l’entreprise n’a pas effectués.
Un détail compte pour les lecteurs d’Allemagne, d’Autriche et de Suisse : Sakana ne dessert toujours ni l’Union européenne ni l’Espace économique européen, invoquant le RGPD et des « réglementations propres à l’UE ». Pour une grande partie du public de ce site, il s’agit donc d’un produit sur lequel on peut lire, mais que l’on ne peut pas utiliser.
Ce que cela signifie pour vous : Si vous êtes dans l’UE, rien pour l’instant. Si vous vivez ailleurs et dépensez des sommes importantes en appels d’API, les routeurs constituent une catégorie à surveiller, mais considérez les benchmarks des fournisseurs comme du marketing tant qu’un acteur indépendant ne les a pas reproduits. La leçon générale est plus universelle : l’idée selon laquelle il faudrait s’engager auprès d’un seul fournisseur de modèles commence à s’effriter. Reste à savoir si la couche intermédiaire qui remplace ce choix mérite sa propre marge.
Sources
Un modèle ouvert allemand avait des réponses de test dans ses données d’entraînement, et c’est grâce à son ouverture que nous le savons
Le consortium à l’origine de Soofi S a reconnu que des questions du benchmark scientifique GPQA s’étaient retrouvées dans son jeu d’entraînement. La communauté l’a remarqué parce que les données étaient publiques. L’équipe a retiré le benchmark et recalculé tous les résultats.