CourionAI
FR
Newsletter
← Toutes les actus
local-ai 3 min de lecture

Un modèle de 80 milliards de paramètres fonctionne désormais sur un Mac normal avec 4,3 Go de mémoire, et un modèle de 35 milliards sur un iPhone

Swiftlet est un environnement d'exécution ouvert qui diffuse les poids experts d'un modèle à partir du SSD au lieu de les charger en mémoire. Un modèle Qwen avec 80 milliards de paramètres culmine à 4,3 Go de RAM sur un Mac. Le compromis est la vitesse et un téléchargement volumineux.

Un ordinateur portable et un téléphone reliés par un mince ruban à un vaste entrepôt de tiroirs, un tiroir pouvant être retiré à la demande

Un développeur a publié Swiftlet, un runtime open source qui exécute de très grands modèles ouverts sur du matériel Apple ordinaire en refusant de charger la majeure partie du modèle en mémoire. Les gros titres : Qwen3-Next-80B, un modèle avec 80 milliards de paramètres, prend 42 Go sur disque mais culmine à 4,3 Go de RAM sur un Mac M5, produisant environ 5 mots de texte par seconde. Un Qwen de 35 milliards de paramètres fonctionne sur un iPhone 17 sur environ 2,5 Go. Le code est sous licence Apache 2.0.

L’astuce réside dans l’architecture du modèle. Ces modèles Qwen sont ce qu’on appelle un mixture of experts, ce qui signifie que le modèle est divisé en centaines de sous-réseaux spécialisés et que seulement une poignée d’entre eux sont utilisés pour un mot donné. Le modèle 80B achemine chaque jeton vers 10 de ses 512 experts, de sorte que seulement 3 milliards de paramètres environ fonctionnent réellement à la fois. Swiftlet conserve ce petit noyau actif en permanence en mémoire, environ 2,5 Go, et récupère les experts individuels du SSD exactement quand ils sont nécessaires. Il les regroupe dans une taille fixe, de sorte qu’un expert équivaut à une lecture de disque et met en cache les plus populaires. Les SSD Apple sont suffisamment rapides pour que les ratés fassent à peine mal.

Qu’est-ce qui se cache derrière cela. Pendant deux ans, la règle générale pour exécuter l’IA localement était simple : le modèle doit tenir dans votre mémoire, donc un modèle 70B signifiait une machine coûteuse. Le streaming expert enfreint discrètement cette règle pour une famille spécifique de modèles. Ce n’est pas une idée nouvelle, l’auteur crédite les projets antérieurs TurboFieldfare et ANEMLL, mais il s’agit de la première version livrée sous forme de bibliothèque, d’outil de ligne de commande, de serveur local compatible OpenAI et d’application iPhone terminée. L’auteur indique également d’emblée la limitation honnête, et c’est la phrase la plus utile de tout le fichier Lisez-moi : comme seuls environ 3 B paramètres sont actifs par jeton, ces modèles “discutent et écrivent comme de grands modèles mais rappellent des faits comme de petits”. La taille sur le disque n’est pas une connaissance dans votre poche.

Ce que cela signifie pour vous: si vous possédez un Mac Apple Silicon et que vous êtes curieux d’exécuter l’IA sur votre propre machine, sans rien envoyer à un serveur, cela abaisse considérablement la barre matérielle. Prévoyez l’espace disque, 18 Go pour le 35B et 42 Go pour le 80B, et attendez-vous à une vitesse de lecture plutôt qu’à des réponses instantanées. Sur iPhone, le 35B gère actuellement environ un mot par seconde, ce qui est une démo plutôt qu’un outil quotidien. Si vous ne bricolez pas, la chose à retenir est directionnelle : l’écart entre ce que fait un centre de données et ce que fait votre ordinateur portable ne cesse de se réduire, et l’IA locale respectueuse de la vie privée est de plus en plus difficile à considérer comme un passe-temps.

Sources

Sources: https://github.com/leonickson1/Swiftlet

Article suivant

Un nombre record de huit gagnants et finalistes du Pulitzer divulgués en utilisant l'IA, et la raison pour laquelle ils l'ont utilisée est la partie intéressante

Huit lauréats du prix Pulitzer ont déclaré utiliser l’IA cette année, soit le plus grand nombre depuis que la divulgation est devenue obligatoire en 2024. Dans presque tous les cas, l’outil a été utilisé pour rechercher ou traduire de grandes piles de documents, et non pour écrire.

Une imposante pile de boîtes à documents balayées par une loupe, tandis qu'une platine de machine à écrire vide reste intacte sur le côté