CourionAI
FR
Newsletter
← Toutes les actus
local-ai 3 min de lecture

KoboldCpp 1.120 ajoute une nouvelle façon de charger des modèles et prend en charge les modèles ouverts les plus récents

Une version silencieuse du samedi pour l'une des façons les plus conviviales d'exécuter des modèles d'IA sur votre propre ordinateur. Nouveautés de cette version : un mode de chargement DirectIO, la prise en charge dès le premier jour de Qwen3.8-Flash-Next et Ling-3.0-flash, ainsi que des outils JavaScript personnalisés.

Une tour d'ordinateur de bureau avec sa façade ouverte et un large ruban de ruban adhésif alimentant celle-ci directement à partir d'une bobine posée au sol

KoboldCpp, l’un des moyens les plus simples d’exécuter un modèle d’IA sur votre propre machine, a livré la version 1.120 samedi. Si vous ne l’avez jamais utilisé : il s’agit d’un seul fichier téléchargeable, sans installateur ni environnement Python avec lequel lutter, qui charge un modèle ouvert à partir du disque et vous offre une fenêtre de discussion dans votre navigateur. Cette version est petite mais utile, et c’est une bonne excuse pour expliquer quelques choses qui semblent intimidantes et qui ne le sont pas.

L’ajout principal est un mode de chargement de modèle DirectIO, activé avec --usedirectio. Charger un modèle signifie copier plusieurs gigaoctets de votre disque vers la mémoire avant que quoi que ce soit ne puisse se produire, et par défaut, le système d’exploitation essaie d’être intelligent en mettant ces octets en cache en cours de route. DirectIO ignore cette couche intermédiaire et lit directement à partir du lecteur, ce qui, sur de nombreux systèmes, signifie un démarrage plus rapide et moins de mémoire gaspillée sur un cache dont vous n’avez pas besoin. Connexe : mlock et mmap peuvent désormais être combinés, deux anciennes options qui contrôlent si le modèle est épinglé en mémoire ou mappé paresseusement à partir du disque. La version ajoute également la prise en charge dès le premier jour de deux tout nouveaux modèles ouverts, Qwen3.8-Flash-Next et Ling-3.0-flash d’Alibaba, et le responsable ajoute un avertissement qui mérite d’être répété : il y a de mauvaises quantifications de ceux-ci qui circulent, alors prenez les fichiers d’une source de confiance. Pour compléter le tout, des outils JavaScript personnalisés configurables par l’utilisateur dans l’interface Kobold Lite intégrée, compatibles avec le format d’appel d’outil standard, ainsi que des correctifs de génération d’images et les fusions habituelles de llama.cpp en amont.

Que se passe-t-il réellement ici : des versions comme celle-ci constituent la moitié peu glamour de l’IA locale, et elles comptent plus que les annonces de modèles. Un nouveau modèle ouvert n’est utile que lorsque quelque chose sur votre ordinateur peut réellement le charger, et l’écart entre « poids publiés sur Hugging Face » et « fonctionne sur un ordinateur portable normal » est comblé par des projets comme celui-ci, llama.cpp en dessous, et par les personnes qui créent des versions quantifiées. La quantification, si c’est un nouveau mot, est l’astuce consistant à stocker les nombres d’un modèle avec une précision inférieure afin qu’ils tiennent dans moins de mémoire, à un faible coût en qualité. Obtenir le support dès le premier jour pour un modèle publié trois jours plus tôt est le genre de chose qui décide tranquillement si les poids ouverts sont une véritable alternative ou simplement un communiqué de presse.

Ce que cela signifie pour vous : si vous êtes curieux de gérer un modèle localement, c’est un point de départ véritablement à faible engagement. Téléchargez un fichier pour votre système, récupérez un modèle quantifié et vous disposez d’un assistant privé qui fonctionne hors ligne et ne coûte rien par message. Il ne correspond pas à un modèle frontière d’un grand laboratoire, et vous devriez vous attendre à ce qu’il soit plus lent et moins performant, mais pour rédiger, résumer et demander des choses que vous préférez ne pas envoyer au serveur de qui que ce soit, cela suffit souvent. Si vous utilisez déjà KoboldCpp, la raison pratique de mettre à jour réside dans les deux nouveaux modèles et, sur les machines dotées de disques rapides et d’une mémoire restreinte, l’indicateur DirectIO. Tout le monde peut volontiers ignorer celui-ci et attendre la prochaine version.

Sources

Sources: https://github.com/LostRuins/koboldcpp/releases/tag/v1.120

Article suivant

Pas de vendredis IA : un argumentaire d'un développeur pour désactiver l'assistant une fois par semaine

Le créateur de HTML, Carson Gross, a publié un manifeste d'une page demandant aux équipes de coder sans assistants IA un jour par semaine. Il a atteint le sommet de Hacker News, et l’argument est facile à emprunter même si vous n’écrivez jamais de code.

Une grille de calendrier avec une colonne arrachée et un câble d'alimentation débranché s'éloignant de l'espace