CourionAI
FR
Newsletter
← Toutes les actus
ollama 2 min de lecture

Accélération gratuite : Ollama rend l’IA locale jusqu’à 90 % plus rapide sur Mac

Ollama, le moyen le plus simple d’exécuter des modèles d’IA sur votre propre ordinateur, vient d’accélérer spectaculairement le modèle Gemma 4 de Google sur les machines Apple. Aucun réglage ni compromis : mettez à jour et profitez du gain. Voici le fonctionnement de l’astuce ingénieuse.

Illustration en risographie : un ordinateur portable avec des lignes de vitesse corail et un lapin qui sprinte, une forte accélération de l’IA locale sur Mac

Il arrive que les logiciels s’améliorent de la manière la plus agréable : vous les mettez à jour et ils sont simplement plus rapides, rien à configurer, rien à payer, aucun piège. C’est ce qui est arrivé cette semaine aux personnes qui exécutent des modèles d’IA sur leur propre Mac. Ollama, un outil gratuit qui rend l’exécution locale d’un modèle presque aussi simple que l’installation d’une application, a publié sa version 0.31. Avec elle, le modèle Gemma 4 de Google génère désormais du texte jusqu’à 90 % plus vite sur les ordinateurs Apple.

Un rapide point de repère si vous découvrez cet univers : au lieu de discuter avec une IA dans le cloud comme ChatGPT, vous pouvez télécharger gratuitement un modèle et l’exécuter directement sur votre ordinateur. Vos questions ne quittent jamais la machine, le système fonctionne hors ligne et chaque utilisation est gratuite. Le défaut traditionnel était la vitesse, les modèles locaux paraissent souvent lents à côté de leurs cousins du cloud. Voilà pourquoi cette mise à jour compte.

L’astuce s’appelle la prédiction de plusieurs tokens, et elle est véritablement ingénieuse. Un modèle produit normalement le texte token par token. Un token est un fragment de mot, « com-pré-hension » pourrait en comporter trois. Désormais, un petit modèle rapide servant de « brouillon » prend de l’avance et propose plusieurs tokens à venir, puis le grand modèle vérifie tout le lot d’un seul coup : il conserve ce qui est juste et refait ce qui ne l’est pas. C’est comme un rédacteur junior qui prépare des phrases qu’un rédacteur en chef valide par groupes. Le résultat est identique à ce que le grand modèle aurait produit seul ; il arrive simplement plus tôt. Les textes prévisibles comme le code informatique en profitent le plus, c’est l’origine du chiffre de 90 %. Une conversation libre est plutôt accélérée de 20 à 40 %, ce qui reste très sensible.

En coulisses, les puces Apple les plus récentes bénéficient d’autres gains de vitesse. Ollama précise aussi que Gemma 4 est seulement le premier modèle à recevoir ce traitement, d’autres suivront.

Ce que cela signifie pour vous : Si vous utilisez déjà Ollama avec Gemma 4, lancez la mise à jour et profitez-en, vous avez terminé. Si vous vouliez essayer l’IA sur votre propre ordinateur mais pensiez qu’elle serait désespérément lente, cette idée vieillit très vite et très mal. Un Mac récent et une soirée libre suffisent pour tenter l’expérience, et de telles mises à jour réduisent discrètement l’écart avec le cloud.

Sources

Sources: https://ollama.com/blog/faster-gemma-4-mlx-mtp

Article suivant

Les escrocs ont trouvé une nouvelle astuce : enregistrer les adresses web inventées par l’IA

Les chatbots d’IA inventent parfois des adresses web inexistantes, et des chercheurs ont découvert qu’ils reproduisaient toujours les mêmes. Des attaquants achètent désormais ces adresses et y créent de faux sites en attendant les utilisateurs de l’IA. Voici comment ne pas tomber dans leur piège.

Illustration en risographie : la barre d’adresse d’un navigateur se dissout en vapeur avec un petit crochet corail, des adresses web inventées par l’IA deviennent des pièges