CourionAI
FR
Newsletter
← Toutes les actus
open-weights 4 min de lecture

Qwen3.8-Max d'Alibaba a passé 16 jours à écrire un outil par lui-même, et les poids seront rendus publics la semaine prochaine

Alibaba a publié tous les détails et les tests de référence pour Qwen3.8-Max, un modèle de 2 400 milliards de paramètres conçu pour des tâches qui s'exécutent pendant plusieurs jours. Cinq études de cas couvrent le codage autonome, la reproduction sur papier, la conception de puces et une année simulée de vente au détail en ligne.

Un long établi recouvert d'une chaîne de petits engrenages, de portes et de leviers, avec un fil continu sur toute sa longueur et un tabouret vide à côté.

Alibaba a dressé un tableau complet du Qwen3.8-Max, le modèle phare présenté en avant-première à la mi-juillet, et cette fois, les chiffres et les études de cas l’accompagnent. Le modèle compte 2,4 billions de paramètres au total, dont 95 milliards actifs par requête, et l’équipe affirme que les poids augmenteront sur Hugging Face et ModelScope la semaine prochaine. Cela en ferait le premier modèle de la classe Qwen-Max que vous pouvez télécharger et exécuter vous-même.

Le pitch ne propose pas de meilleures réponses à des questions uniques. C’est ce que le domaine appelle le travail à long terme, c’est-à-dire des tâches qui s’étendent sur des jours et comportent des centaines d’étapes. Alibaba a publié cinq études de cas pour illustrer ce point. Dans la première, le modèle a passé 16 jours à créer un outil de ligne de commande appelé oh-my-cli : il a transformé les requêtes entrantes des utilisateurs en problèmes GitHub, les a attribuées à lui-même, a écrit le code, a exécuté les tests et itéré. Au 30 juillet, il avait enregistré 265 commits, 127 pull request et 151 problèmes sans qu’aucun humain ne touche le clavier. Dans un autre, avec uniquement un document de recherche et aucun code de démarrage, il a reproduit les six résultats du document sur environ 125 heures de calcul, puis a testé 18 idées et a battu la méthode originale sur un test mathématique de 2,7 points.

Deux exécutions supplémentaires testent la planification plutôt que le codage. Lorsqu’on lui a demandé de concevoir un circuit cryptographique, le modèle est parti d’une conception fonctionnelle mais gonflée utilisant 8 298 portes logiques, les éléments de commutation de base d’une puce, et l’a ramené à 678 sur environ 500 itérations. Après une mise en page automatisée, la zone physique a diminué de 81 pour cent. Dans une simulation d’un exercice financier complet de vente au détail en ligne, basée sur des données anonymisées de Taobao et Tmall, l’entreprise a commencé avec 100 000 yuans, a négocié avec les fournisseurs en langage clair, a géré les retours et les typhons, a repéré les escrocs cachés dans le pool de fournisseurs et a terminé avec 416 252 yuans.

Qu’est-ce qui se cache derrière cela. Alibaba attribue ce saut à la manière dont il a organisé l’apprentissage par renforcement, l’étape de formation au cours de laquelle un modèle est récompensé pour ses bons résultats plutôt que de recevoir des réponses correctes. Au lieu de s’entraîner sur des tâches uniques, il s’est exercé dans environ 4 000 environnements différents couvrant des flux de travail sur plusieurs jours, des dossiers de projets imbriqués et plusieurs cadres d’agents différents. Son indice de score interne sur plus de dix indices de référence est passé de 0,474 à 0,725, puis a légèrement baissé au-delà de ce point. Il convient de garder les attentes fondées : tous ces chiffres sont auto-déclarés à partir d’analyses internes, personne en dehors de l’entreprise ne les a vérifiés, et un modèle qui quadruple l’argent fictif dans une simulation n’a pas géré de véritable magasin. Le contexte concurrentiel compte également. Le Kimi K3 de Moonshot a ouvert ses poids le 27 juillet et des tests indépendants ont ramené ses affirmations sur terre.

Ce que cela signifie pour vous: rien aujourd’hui, sauf si vous louez du temps GPU à l’heure. Un modèle de 2 400 milliards de paramètres n’est pas quelque chose que vous exécutez sur un ordinateur portable, donc dans la pratique, la plupart des gens y parviendront via un service hébergé. Ce qui est vraiment utile, c’est le choix de compatibilité : Qwen3.8-Max parle à la fois les formats API d’OpenAI et d’Anthropic, il passe donc dans Claude Code, Codex et des outils similaires en modifiant un paramètre. Si vous payez déjà par jeton pour un agent qui exécute des tâches de longue durée, il s’agit d’un véritable levier de prix qui mérite d’être testé une fois que les poids ont atterri. Si vous ne le faites pas, le signal à retenir est que les camps ouverts et fermés sont désormais à peu près séparés par un pas plutôt qu’une génération.

Sources

Sources: https://qwen.ai/blog?id=qwen3.8

Article suivant

Deux équipes de recherche ont résolu le même problème ouvert avec le même modèle d'IA, à trois heures d'intervalle

Un doctorant du MIT et deux professeurs ont résolu indépendamment la même question en cryptographie quantique à l'aide de GPT-5.6 Sol Ultra et ont publié leurs articles sur arXiv à trois heures d'intervalle. Cela soulève une question délicate sur ce que signifie aujourd’hui la découverte indépendante.

Deux enveloppes identiques scellées à la cire arrivant dans la même fente par des côtés opposés au même instant, devant un cadran d'horloge arrêté