CourionAI
FR
Newsletter
← Toutes les actus
models 3 min de lecture

Le nouveau modèle de Sakana n'est pas un modèle, c'est un répartiteur pour d'autres modèles

Fugu Max et Fugu Ultra v2, sortis le 11 septembre, ne répondent pas eux-mêmes à votre question. Ils choisissent lequel d'un pool de modèles ouverts et spécialisés devrait, et à 2 dollars par million de jetons d'entrée, Fugu Max réduit de moitié le niveau frontière.

Un podium de chef d'orchestre vide avec un éventail de matraques, face à un demi-cercle de pupitres vides

Sakana AI a publié deux nouveaux systèmes le 11 septembre, Fugu Max et Fugu Ultra v2, et ce qui est intéressant, c’est ce qu’ils ne sont pas. Il n’existe pas non plus un seul grand modèle qui lit Internet et répond désormais à vos questions. Chacun est un orchestrateur : un modèle dont la compétence réelle consiste à décider quel autre modèle doit gérer le travail qui lui est confié, puis à confier le travail, parfois à plusieurs modèles en séquence, parfois à une autre copie de lui-même. Le pool vers lequel il est acheminé est principalement constitué de modèles ouverts et spécialisés, c’est-à-dire de modèles dont tout le monde peut télécharger et exécuter les fichiers.

Le prix est le pitch. Fugu Max coûte 2 dollars par million de jetons d’entrée et 6 par million de sortie, soit environ 40 à 60 % de moins que Sonnet 5 et GPT-5.6 Terra, et Sakana affirme qu’il se classe meilleur sur six des dix benchmarks qu’il rapporte, y compris Terminal Bench 2.1 et GPQA Diamond. Fugu Ultra v2 vise plus haut et coûte plus cher, 5 dollars entrants et 30 dollars sortants, avec des invites plus longues facturées à un tarif plus élevé, et rapporte 48,3 sur Chartography et 74,3 sur DeepSWE. Sakana tient à noter qu’il atteint ces chiffres sans Fable 5, Fable 5.1 ou GPT-6 Astra nulle part dans son pool, les résultats proviennent donc de pièces moins chères bien assemblées. Les deux se trouvent derrière une API qui parle le même format que celle d’OpenAI, donc le changement est principalement un changement d’adresse. Une ligne en petits caractères mérite attention : le routage lui-même consomme des jetons, et ils sont facturés.

Qu’est-ce qu’il y a derrière ça

L’hypothèse tacite des trois dernières années était que si vous voulez une meilleure réponse, vous achetez un modèle plus gros. Le routage remet cela en question. La plupart des demandes ne sont pas difficiles. Résumer un email, réécrire un paragraphe, corriger un bug évident : un petit modèle ouvert gère tout cela parfaitement pour une fraction du coût, et seule une minorité de requêtes a réellement besoin du modèle de raisonnement coûteux. Un routeur capable de distinguer les deux capture l’essentiel de la qualité pour une fraction de l’argent. Le hic, c’est qu’un routeur est une chose de plus qui peut être fausse, d’une manière qui est ennuyeuse à déboguer, car une réponse médiocre peut être une mauvaise réponse ou simplement un mauvais choix de qui a répondu. Et les chiffres de référence ici sont ceux de Sakana, sur la base des références sélectionnées par Sakana.

Ce que cela signifie pour vous : Si vous utilisez l’IA via une fenêtre de discussion, cela ne change rien à ce que vous pouvez voir, mais c’est une bonne chose à comprendre, car le routage devient également le mode de fonctionnement des grands assistants. C’est pourquoi le même produit semble parfois génial et parfois paresseux : vous ne parlez pas toujours au même modèle. Si vous payez pour l’utilisation de l’API, Fugu Max vaut un test honnête sur votre propre charge de travail, puisqu’une réduction de 40 à 60 % sur une facture que vous payez déjà représente de l’argent réel. Deux mises en garde avant de déplacer quelque chose d’important : effectuez votre propre comparaison plutôt que de vous fier au tableau de lancement, et ajoutez les jetons d’orchestration dans vos calculs avant de décider que c’est moins cher.

Sources

Sources: https://sakana.ai/fugu-max-release/

Article suivant

DeepMind a publié une prédiction pour chaque lettre que vous pourriez modifier dans l'ADN humain

AlphaGenome Atlas est un ensemble de données d'un pétaoctet couvrant les 9 milliards de variantes possibles d'ADN à une seule lettre, précalculé afin que les chercheurs puissent rechercher une réponse au lieu d'exécuter un modèle. Il est gratuit pour la recherche non commerciale.

Un mur de tiroirs de catalogues de cartes de bibliothèque, deux d'entre eux s'ouvrent et se déroulent en un ruban à double hélice torsadé.