Nous avons fait tourner une IA locale sur un processeur d’entrée de gamme vieux de six ans. Voici ce qu’elle sait vraiment faire.
Deux cœurs, aucune carte graphique et quatre gigaoctets de mémoire : voilà le minimum pour exécuter une IA sur son propre ordinateur. Nous avons mesuré sa vitesse, soumis le modèle à nos tests habituels et relevé chacun de ses échecs.
Le verdict en bref
- De quoi s’agit-il ? Faire fonctionner un modèle d’IA sur son propre ordinateur, sans compte, sans abonnement et sans connexion à Internet
- Ce que nous avons testé : Qwen2.5 1.5B Instruct, un petit modèle à poids ouverts, dans sa version compressée Q4_K_M d’environ 1,1 gigaoctet
- Qui le développe ? Le modèle vient d’Alibaba et le moteur du projet open source llama.cpp
- Sur quelle machine ? Un AMD Ryzen 3 3250U, processeur d’ordinateur portable d’entrée de gamme datant de 2020, avec deux cœurs disponibles, environ 3,8 gigaoctets de mémoire et aucune carte graphique dédiée
- Date du test : 25 juillet 2026, build b10107 de llama.cpp
- Prix : 0 euro, sans compte
- Disponibilité dans l’UE : oui, sans inscription ni condition particulière à vérifier
- Vitesse : de 4,8 à 6,9 tokens générés par seconde, soit environ quatre mots
- Idéal pour : remanier hors ligne et en toute confidentialité un texte que vous possédez déjà
- À éviter pour : toute tâche qui exige des faits exacts
- En une phrase : sur un matériel aussi modeste, l’IA locale sert à façonner du texte, pas à fournir des connaissances ; dans cette limite, elle est réellement utile
La plupart des guides consacrés à l’IA locale commencent par recommander une carte graphique plus chère qu’une voiture d’occasion. Pour les grands modèles, cela se comprend. Mais cela laisse aussi entendre, sans le dire, que les millions de personnes équipées d’un portable ordinaire n’y ont pas accès.
Nous avons donc pris le problème à l’envers. Au lieu de chercher « la meilleure configuration locale », nous avons posé une autre question : où se situe le minimum ? Que se passe-t-il sur une machine que personne ne qualifierait de station de travail ?
La réponse s’est révélée plus intéressante que prévu.
Ce que signifie réellement « exécuter un modèle en local »
Lorsque vous utilisez ChatGPT ou Claude, votre texte est envoyé dans un centre de données. Un modèle y produit une réponse, qui vous est ensuite renvoyée. En local, le fichier du modèle se trouve sur votre disque dur et c’est votre ordinateur qui effectue les calculs. Rien ne quitte la machine. Le système fonctionne même dans un train sans réseau.
Cette autonomie se paie par la taille. Le modèle téléchargé doit tenir dans la mémoire disponible ; ceux que l’on peut faire tourner chez soi sont donc bien plus petits que les modèles des centres de données. Qui dit plus petit dit moins de connaissances et un raisonnement moins solide. Reste à savoir si ce qu’il en reste présente encore un intérêt.
Trois évolutions rendent l’expérience possible sur un matériel modeste. La quantification compresse le modèle, un peu comme lorsqu’une photo est enregistrée dans un fichier JPEG plus petit : on perd certains détails, mais le fichier s’allège fortement. Les petits modèles ont par ailleurs fait d’immenses progrès. Avec 1,5 milliard de paramètres, les valeurs ajustables apprises pendant l’entraînement, un modèle accomplit aujourd’hui ce qui en exigeait dix fois plus il y a deux ans. Enfin, llama.cpp, le moteur open source retenu pour notre test, est conçu pour des processeurs ordinaires plutôt que pour des cartes graphiques coûteuses. C’est ce même moteur que l’on retrouve sous les interfaces plus accessibles d’Ollama, LM Studio et Jan.
Notre méthode de test
Nous avons exécuté llama-cli, issu du build b10107, dans un conteneur Linux. Le fichier qwen2.5-1.5b-instruct-q4_k_m.gguf, téléchargé depuis Hugging Face et pesant environ 1,1 gigaoctet, utilisait deux threads de processeur, une fenêtre de contexte de 512 tokens, la quantité de texte que le modèle peut garder à l’esprit, et une température comprise entre 0,2 et 0,3 afin d’obtenir des réponses plus prévisibles et moins créatives.
Nous lui avons ensuite soumis quatre tâches de notre batterie habituelle et avons consigné les résultats, y compris ce qui n’a pas fonctionné.
Ce que nous n’avons pas testé, en toute transparence. Nous avons piloté le moteur en ligne de commande, et non avec Ollama, LM Studio ou Jan. Ces applications ajoutent une interface conviviale au même moteur ; les performances devraient donc être comparables, mais nous ne les avons pas mesurées. Nous avons aussi écarté trois tests habituels : les documents longs et les tâches en plusieurs étapes nécessitent un contexte que cette machine ne peut pas accueillir, et nous n’avons pas essayé d’autre langue européenne que l’allemand. Chaque consigne n’a été lancée qu’une fois : les résultats donnent une indication, pas une moyenne. Dernière précision, Qwen2.5 date de septembre 2024. Nous l’avons choisi parce qu’il s’agit du petit modèle le plus largement répliqué et le mieux documenté, non parce qu’il est le plus récent. Les nouveaux petits modèles disposent de connaissances plus fraîches. Leurs vitesses devraient néanmoins être comparables à celles indiquées ci-dessous, tandis que notre critique sur l’ancienneté des connaissances pourrait ne plus s’appliquer.
Les mesures
Commençons par la vitesse : c’est elle qui détermine si l’outil est utilisable.
- Lecture de la saisie : de 11,3 à 12,5 tokens par seconde
- Rédaction de la réponse : de 4,8 à 6,9 tokens par seconde
- Chargement depuis le disque : environ 20 secondes la première fois, puis moins lorsque le fichier reste en mémoire
Un token représente à peu près trois quarts de mot. La sortie atteint donc environ 3,5 à 5 mots par seconde, soit un rythme de lecture lent. Les mots apparaissent les uns après les autres et une courte réponse demande entre dix et vingt secondes.
La mémoire n’a posé aucun problème. Le modèle occupait environ un gigaoctet sur les presque quatre disponibles, sans qu’il soit nécessaire de transférer des données vers le disque.
Ses points forts
Il a parfaitement structuré un texte désordonné. Nous lui avons fourni cette liste de courses volontairement brouillonne : milk 1.29 two bottles; bread three euro fifty one loaf; 6 eggs 2,80 EUR, en lui demandant un tableau avec le produit, le prix et la quantité. Voici sa réponse :
| Item | Price (EUR) | Quantity |
|-------|-------------|----------|
| Milk | 1.29 | 2 |
| Bread | 3.50 | 1 |
| Eggs | 2.80 | 6 |
Il a transformé « three euro fifty » en 3,50, correctement interprété la virgule de « 2,80 » et compris que « 6 eggs » indiquait une quantité de six plutôt qu’un prix. Tout cela en quelques secondes, sur un processeur bon marché vieux de six ans.
C’est dans ce domaine qu’il fonctionne : reformater, extraire, nettoyer et convertir. Le texte entre, ressort mieux organisé, sans que le modèle ait besoin de connaître le monde.
Il a su reconnaître ses lacunes. Interrogé sur le chancelier allemand en fonction et sur l’entrée en vigueur des règles de transparence du règlement européen sur l’IA, il a répondu qu’à sa dernière mise à jour, en 2023, Olaf Scholz était chancelier, mais qu’il ne disposait pas d’information précise sur la seconde date. La première partie est dépassée. La seconde est encourageante : voir un petit modèle signaler spontanément les limites de ses connaissances au lieu d’inventer une date est préférable au comportement de modèles beaucoup plus imposants.
La rédaction simple a fonctionné. Il a produit en anglais un courriel poli pour décliner une réunion, bien structuré et correctement mis en forme, avec des champs pertinents entre crochets pour le nom et le motif.
Là où il échoue
L’allemand est nettement moins bon que l’anglais. Invité à rédiger un refus poli en allemand, le modèle a livré un texte compréhensible mais raide. Il a notamment inventé « Absagezeilen », un terme que personne n’emploie, et formulé une phrase sur l’engagement dans un projet important qui sentait la traduction. Pour notre lectorat, cela compte davantage qu’un benchmark : en allemand, en français ou en italien, un petit modèle local paraît plus maladroit que sur la même tâche en anglais. La génération est aussi tombée à 4,8 tokens par seconde en allemand, le résultat le plus lent des quatre tests.
Les brouillons sont génériques. Le courriel était juste, mais sans personnalité. Le modèle ignore votre ton, votre situation et la véritable raison du refus. Un assistant cloud payant doté d’une mémoire peut réduire cet écart ; ici, il demeure.
Ses connaissances sont datées et rien ne permet d’y remédier. Son monde s’arrête en 2023. Pas de recherche sur le Web, pas de mise à jour, pas de mémoire. Pour un sujet d’actualité, c’est le mauvais outil, quel que soit le soin apporté à la consigne.
L’attente fait partie de l’expérience. Vingt secondes de chargement, puis cinq mots par seconde. Cela convient à un bref reformatage. Pour un long texte, chaque seconde se fait sentir.
Le coût et l’accès en Europe
Le prix est nul, et c’est l’essentiel. Aucun abonnement, aucun compte, aucune carte bancaire, aucune liste d’attente. Il faut seulement accepter 1,1 gigaoctet sur le disque, environ un gigaoctet de mémoire pendant l’exécution et un peu de patience.
Alibaba publie Qwen2.5 1.5B Instruct sous licence Apache 2.0, qui autorise l’utilisation commerciale. Ce n’est pas le cas de tous les modèles ouverts : vérifiez la licence avant d’en faire la base d’une activité. llama.cpp utilise une licence MIT. Aucun des deux n’impose de restriction géographique ; il n’y a donc ni problème d’accès en Europe, ni fonctionnalité qui arrive six mois plus tard.
En matière de confidentialité, il est difficile de faire mieux. Votre texte ne quitte jamais l’ordinateur. Il n’existe ni fournisseur à qui adresser une demande sur les données, ni conditions d’utilisation à lire, ni option d’entraînement à désactiver dans les réglages, puisqu’aucun transfert n’a lieu. Pour qui manipule des données de clients, des notes médicales ou tout contenu susceptible d’intéresser un délégué européen à la protection des données, « traité dans l’UE » et « jamais sorti de ce portable » sont deux situations très différentes.
À qui convient-il, et qui devrait passer son chemin ?
L’expérience vaut la peine si vous avez un ancien ordinateur inutilisé, traitez des textes que vous préférez ne pas téléverser, travaillez parfois hors ligne ou souhaitez comprendre concrètement cette technologie en en faisant tourner une partie chez vous. Elle a aussi du sens si vous refusez simplement de payer chaque mois pour une tâche que votre propre machine peut accomplir.
Passez votre chemin si vous avez besoin de faits, d’informations récentes ou d’une rédaction soignée dans une autre langue que l’anglais. Même conseil si l’attente vous agace. Enfin, ce petit modèle ne remplacera pas un assistant payant : prétendre le contraire ne ferait que vous gâcher la soirée.
Les autres possibilités
Ollama offre à la plupart des gens la voie d’accès la plus simple. Un programme d’installation, une commande, et le modèle fonctionne. Le moteur est le même, avec une bibliothèque dans laquelle chaque modèle se récupère par son nom.
LM Studio et Jan remplacent le terminal par une fenêtre de conversation, intègrent la recherche de modèles et n’exigent aucune ligne de commande. Si les commandes vous rebutent, commencez par l’un d’eux.
Un modèle plus grand selon le même principe. Avec 16 gigaoctets de mémoire ou une carte graphique correcte, les modèles de 7 à 12 milliards de paramètres offrent une tout autre expérience : meilleur allemand, meilleur raisonnement, toujours gratuitement et en local. Gemma 4 12B illustre bien les progrès de cette catégorie.
Un modèle cloud européen si le local ne suffit pas. En juillet 2026, Mistral traite par défaut les données dans l’UE. C’est la meilleure option après « rien n’a quitté mon portable ».
Le verdict
Nous pensions qu’une telle machine échouerait. Ce ne fut pas le cas. Elle a certes buté sur certains points, connaître des faits et bien écrire en allemand, mais elle a parfaitement réussi la tâche quotidienne dont beaucoup ont réellement besoin : remettre de l’ordre dans un texte confus.
Le résultat semble modeste ? Son prix l’est encore plus : rien, pour toujours, hors ligne, sur une machine que vous alliez peut-être jeter.
Voici donc le constat honnête. Un petit modèle local n’est pas une version miniature de ChatGPT. C’est un autre outil doté d’une interface similaire. Considéré comme un traitement de texte enrichi d’une compréhension du langage, il impressionne. Considéré comme un assistant, il déçoit en cinq minutes.
Test réalisé le 25 juillet 2026 avec le build b10107 de llama.cpp et Qwen2.5 1.5B Instruct Q4_K_M. L’IA locale évolue vite et les petits modèles progressent tous les quelques mois. Vérifiez la date de cet article avant de vous fier aux chiffres.
Sources
- Versions de llama.cpp (build b10107 utilisé pour ce test)
- Fiche du modèle Qwen2.5 1.5B Instruct GGUF sur Hugging Face
- Ollama
- LM Studio
- Jan
Qui est qui : Black Forest Labs, le laboratoire allemand présent dans Photoshop et Canva
Fondé en août 2024 à Fribourg-en-Brisgau, Black Forest Labs emploie une centaine de personnes et fournit des modèles d’image à Adobe, Canva et Picsart. Ses origines, ses propriétaires, son modèle économique et ses risques.