Qwen3.8-27B est disponible et fonctionne sur une seule carte graphique de jeu
Alibaba a enfin livré la petite moitié de sa promesse Qwen3.8. Le modèle de 27 milliards de paramètres a atteint la première place de Hacker News parce qu'il peut réellement fonctionner chez soi.
Alibaba a publié Qwen3.8-27B aujourd’hui. Quelques heures plus tard, il occupait la première place de Hacker News avec 893 points. La raison est simple: contrairement au gigantesque Qwen3.8-Max dont les poids sont arrivés il y a trois jours, celui-ci tient sur du matériel accessible. Une RTX 4090 ou un Mac Studio suffit, à condition d’utiliser une version compressée du fichier.
Le modèle est dense, ce qui signifie que ses 27 milliards de paramètres sont utilisés pour chaque mot produit. Il traite les images comme le texte. Son contexte natif, la quantité de texte qu’il peut garder en tête à la fois, atteint 262 144 tokens, soit environ un très long livre. Les vitesses rapportées sur Hacker News vont d’environ 10 tokens par seconde avec une compression agressive à près de 160 sur un Nvidia DGX Spark utilisant le décodage spéculatif, une méthode où un petit modèle propose des mots que le grand vérifie en groupe.
Les benchmarks demandent de la prudence. La fiche d’Alibaba attribue à Qwen3.8-27B un score de 61,7 sur SWE-bench Pro, un test de correction de vrais problèmes logiciels, contre 53,4 pour une configuration Claude Opus. Cette ligne porte presque tous les titres affirmant qu’il rivalise avec Claude Opus. Sur les quatre autres tests du tableau, dont Terminal-Bench et Humanity’s Last Exam, le petit modèle reste derrière, parfois nettement: 30,8 contre 40,0 sur ce dernier.
Voici ce que les titres omettent: les benchmarks des fournisseurs sont autant des documents marketing que des mesures. Des commentateurs ont souligné que les deux modèles avaient été testés avec des structures d’agent, des températures et des prompts différents, ce qui fragilise la comparaison directe. Il existe aussi le soupçon durable que les laboratoires ajustent leurs modèles pour réussir les tests célèbres. Cela ne rend pas la sortie moins impressionnante. Il y a un an, voir un modèle local de 27 milliards de paramètres approcher un modèle commercial de pointe aurait semblé absurde.
Un inconvénient signalé mérite attention avant le téléchargement. Le modèle dispose d’un réglage de l’effort de raisonnement. Au niveau maximal xhigh, plusieurs utilisateurs ont vu des demandes simples prendre de 20 à 90 minutes. Pour le quotidien, restez sur medium ou low.
Ce que cela signifie pour vous: si vous n’avez jamais exécuté un modèle sur votre ordinateur, c’est un bon moment pour essayer. LM Studio référence les versions compressées. Vous pouvez choisir celle qui tient dans votre mémoire et terminer l’installation sans terminal. Rien ne quitte votre machine, ce qui compte pour des documents clients ou des notes privées. Si vous utilisez déjà un assistant hébergé pour programmer, gardez des attentes raisonnables: les modèles locaux se rapprochent, mais la différence reste visible sur les tâches difficiles en plusieurs étapes. Pour la plupart des gens, l’option gratuite et privée vient de s’améliorer nettement.
Sources
Un preneur de notes IA a laissé 181 874 réunions accessibles à tout compte gratuit
Un chercheur en sécurité a découvert que tl;dv, un enregistreur de réunions utilisé par plus de deux millions de personnes, permettait à tout utilisateur connecté de lister toutes les réunions, y compris les appels en cours.