CourionAI
FR
Newsletter
← Toutes les actus
local-ai 3 min de lecture

Un modèle de 125 milliards de paramètres sur une carte graphique ordinaire

Tim Dettmers a présenté en avant-première la semaine open source de son laboratoire : un framework d'inférence exécutant Qwen 3.8 Flash Next sur un seul GPU de 24 Go, DeepSeek V4.1 sur un MacBook et une technique de compactage qui, selon lui, réduit de moitié les coûts des agents.

Une énorme sphère compressée et déformante pour tenir dans une petite boîte de bureau

Tim Dettmers, le chercheur à l’origine de la bibliothèque de quantification bitsandbytes, largement utilisée, a publié lundi un aperçu de ce que son laboratoire universitaire publie cette semaine : deux projets open source et quatre articles, délibérément expédiés ensemble. Les chiffres qu’il contient sont de ceux qui changent ce qui est possible sur le matériel que les gens possèdent déjà. Son cadre d’inférence exécute Qwen 3.8 Flash Next, un modèle de 125 milliards de paramètres, sur une seule carte graphique de 24 Go, celle que l’on trouve dans un ordinateur de bureau ordinaire. Avec une machine AMD Strix, une Nvidia DGX Spark ou un MacBook avec 128 Go de mémoire, il affirme que vous pouvez exécuter DeepSeek V4.1 avec 550 milliards de paramètres. Sur Mac, un modèle Qwen 3.6 35B fonctionne à 450 jetons par seconde à 1,5 bits par poids.

Ce dernier chiffre mérite d’être dévoilé. Chaque paramètre d’un modèle est un nombre, normalement stocké dans 16 bits de mémoire. La quantification réduit ces nombres en moins de bits, et à 1,5 bits, un modèle a besoin d’environ un dixième de la mémoire qu’il aurait autrement. Le métier est la précision, c’est pourquoi il est difficile de le faire sans détruire la qualité du résultat et pourquoi le nom de Dettmers est attaché à une grande partie de ce travail. L’autre pièce est CliffCompaction, une technique de compactage automatique que son laboratoire utilise en interne depuis des mois. La compaction est la façon dont un agent continue de travailler après que sa conversation aurait débordé : elle résume ce qui s’est passé afin qu’il puisse continuer. Il affirme que les sessions fonctionnent pour des millions de jetons, certains de ses cent millions précédents, et que cela réduit les coûts d’environ la moitié. Une entreprise partenaire a mesuré une réduction de 45 % de son budget total en matière d’IA.

Qu’est-ce qu’il y a derrière ça

Dettmers présente l’ensemble du communiqué comme un argument selon lequel la recherche sur l’IA n’appartient pas seulement à celui qui possède le plus de GPU, et que les petits laboratoires universitaires ont un avantage précisément parce qu’ils doivent travailler sur des problèmes peu coûteux à attaquer. C’est une bonne idée, et l’affirmation technique la plus intéressante en dessous est que le plafond de l’IA locale n’a pas été les modèles. Des poids ouverts suffisamment bons pour être utiles sont téléchargeables depuis un certain temps. L’obstacle était qu’un modèle de 125 milliards de paramètres ne rentrerait pas dans une machine normale, de sorte que la plupart des gens ont utilisé de petits modèles et ont conclu que l’IA locale était décevante.

La juste mise en garde : ce sont des affirmations en avant-première provenant d’un article de blog, le code arrivera dans les prochains jours et personne en dehors du laboratoire n’en a reproduit quoi que ce soit. Les résultats de quantification en particulier ont tendance à être meilleurs sur les tests choisis pour les démontrer que sur votre propre travail.

Ce que cela signifie pour vous : Si l’exécution de modèles sur votre propre ordinateur a déjà séduit, pour des raisons de confidentialité, de coût, de travail hors ligne, c’est la semaine pour y réfléchir à nouveau, car les limites de taille dont vous vous souvenez peuvent ne plus s’appliquer. Pour tous les autres, le numéro pertinent est celui du coût. Si une technique de compactage peut réduire de moitié les dépenses d’un agent et que la méthode est publique, elle ne restera pas longtemps une curiosité de recherche. Les agents moins chers sont le mécanisme par lequel tout cela parvient aux produits ordinaires.

Sources

Sources: https://timdettmers.com/2026/09/21/dlab-open-source-week/

Article suivant

Une faille Mac permet à n'importe quelle application de rediriger ce que vous dictez vers l'assistant de Meta

Le chercheur en sécurité Patrick Wardle a révélé un zero-day dans Meta's Muse pour Mac : un paramètre non documenté que tout processus local peut inverser, envoyant des invites dictées au serveur d'un attaquant et exposant le jeton de compte.

Un microphone dont le câble contourne la prise murale et disparaît dans une trappe latérale cachée