CourionAI
FR
Newsletter
← Toutes les actus
local-ai 3 min de lecture

Ollama améliore discrètement l’exécution des modèles ouverts sur Mac

La version 0.32.4 prend en charge Laguna sur les GPU Apple via MLX, affine la quantification mixte des modèles à mélange d’experts et corrige le décodage des MoE Qwen3. Des changements modestes qui déterminent pourtant si l’IA locale est réellement utilisable.

Illustration en risographie d’une tour d’ordinateur de bureau en coupe, contenant une grue en papier plié, avec un pied à coulisse en dessous

Alors que l’attention de la semaine se portait sur un modèle de 1,4 téraoctet, l’outil dont se servent réellement la plupart des utilisateurs pour faire tourner une IA sur leur propre machine a livré des changements plus utiles au quotidien. La branche 0.32.4 d’Ollama ajoute la prise en charge des modèles Laguna de Poolside, plus précisément les variantes XS 2, XS 2.1 et S 2.1, sur les GPU Apple grâce à MLX, le framework d’apprentissage automatique conçu par Apple pour ses puces.

Le reste des notes de version ressemble à de la plomberie technique, et c’est précisément ce qui compte. La mise à jour revoit la quantification des modèles à mélange d’experts. Quantifier consiste à enregistrer les valeurs du modèle avec une précision moindre pour réduire la mémoire nécessaire, un peu comme une photo sauvegardée dans un fichier JPEG plus léger. Appliquée sans discernement, la méthode dégrade la qualité ; utilisée de façon sélective, elle conserve presque toute la qualité tout en économisant beaucoup d’espace. Ollama lit désormais la configuration du modèle d’origine et applique une stratégie cohérente aux couches denses comme aux experts activés à la demande. Le routeur et la tête de sortie liée restent en pleine précision, l’attention et les projections des experts sont quantifiées, puis les projections descendantes les plus sensibles retrouvent sélectivement une précision supérieure. La version corrige aussi le décodage des modèles Qwen3 à mélange d’experts dont les experts n’avaient pas tous été quantifiés de la même manière. Sur un M5 Max, elle accélérerait d’environ 4 à 9 % les projections de porte et les projections ascendantes regroupées.

Ce travail peu spectaculaire décide pourtant si l’IA locale existe dans la pratique. Sur un ordinateur portable, la limite vient rarement de l’intelligence du modèle ; elle vient de la mémoire. Entre un modèle qui tient dans la RAM et un autre qui n’y tient pas, une réponse peut prendre deux secondes ou deux minutes, à moins que le modèle ne fonctionne pas du tout. Chaque progrès dans la manière de compresser proprement un modèle fait passer toute une catégorie du second groupe au premier. Le mélange d’experts compte d’autant plus que cette architecture est désormais courante sur les modèles haut de gamme et qu’elle a longtemps résisté à une bonne quantification. Le routeur qui choisit l’expert est minuscule mais extrêmement sensible à la perte de précision : le traiter comme n’importe quelle autre couche suffit à abîmer le modèle.

Ce que cela signifie pour vous : Si vous n’avez jamais exécuté de modèle localement, la version courte est la suivante : c’est possible, gratuit, et rien de ce que vous saisissez ne quitte votre ordinateur. Un Mac récent doté d’au moins 16 Go constitue une machine correcte pour commencer. Ollama ne demande qu’une installation et une commande. Si vous utilisez déjà des modèles locaux sur une puce Apple, cette version mérite la mise à jour : Laguna sur MLX est un véritable ajout, et la nouvelle quantification MoE pourrait rendre accessible un modèle trop volumineux auparavant. Sous Windows ou Linux avec une carte Nvidia, les changements liés à MLX ne vous concernent pas, mais le correctif Qwen3, si. Dans tous les cas, ces progrès réguliers et sans éclat étendent discrètement ce que le matériel que vous possédez déjà peut faire fonctionner.

Sources

Sources: https://github.com/ollama/ollama/releases/tag/v0.32.4

Article suivant

OpenAI analyse 800 000 échanges professionnels et découvre que chacun empiète discrètement sur le métier des autres

Une étude d’OpenAI estime que 43,5 % des usages professionnels spécialisés de ChatGPT concernent des tâches traditionnellement rattachées à un autre métier. Le marketing dépanne du code, les commerciaux analysent leurs données, surtout dans les petites entreprises.

Illustration en risographie de huit établis disposés en grille, chacun portant l’outil d’un métier différent, avec des flèches transportant des objets d’un établi à l’autre