CourionAI
FR
Newsletter
← Toutes les actus
open-models 3 min de lecture

Avec 500 dollars d’entraînement, un modèle 9B surpasse tous les ténors sur une tâche ingrate

Le cabinet Fermisense a spécialisé un petit modèle ouvert dans le contrôle de catalogues e-commerce par apprentissage par renforcement. Il obtient 87,3 %, contre 76,9 % pour la meilleure configuration de pointe, pour un coût par fiche environ 68 fois inférieur.

Illustration en risographie d’un petit oiseau chanteur qui, sur le plateau d’une balance, pèse plus lourd que six imposantes sphères de pierre placées sur l’autre

Un compte rendu publié lundi par le cabinet Fermisense, puis rapidement plébiscité sur Hacker News, avance un résultat qui paraît trop beau pour être vrai jusqu’à ce que l’on examine le protocole. Sur une tâche unique et très ciblée, un modèle open source de 9 milliards de paramètres a devancé tous les modèles de pointe testés, dont GPT-5.6 Sol, Gemini 3.1 Pro et Claude Fable 5. Son entraînement a duré environ trois jours et demi sur deux GPU loués, pour quelque 500 dollars.

La tâche consiste à contrôler des fiches de catalogue : examiner la photo, le titre et la description d’un produit vendu en ligne, le ranger dans la bonne catégorie parmi environ 13 000, extraire les attributs qui alimentent la recherche et les filtres, puis repérer d’éventuelles infractions aux règles. Fermisense a reproduit ce travail sous la forme de ce qu’il appelle un jumeau numérique, une simulation du véritable poste avec les mêmes outils et les mêmes enjeux. Les 177 767 épisodes de contrôle ont été construits à partir du jeu de données public Amazon Berkeley Objects, en y introduisant volontairement des infractions. Comme chaque épisode possède une réponse correcte connue, un système de notation peut évaluer chaque décision, en sanctionnant une infraction manquée sept fois plus qu’une fausse alerte. C’est ce retour chiffré qui rend possible l’apprentissage par renforcement : le modèle tente une réponse, reçoit une note et s’ajuste.

Les résultats sont nets. Même avec 2 800 caractères d’instructions soigneusement optimisées dans le prompt, la meilleure configuration de pointe n’a atteint que 76,9 % du score possible. Le modèle 9B entraîné est monté à 87,3 %, contre 64,2 % avant l’entraînement. Il a dépassé le groupe des modèles de pointe après environ 250 étapes, soit une journée. Le coût pour 1 000 fiches s’établit autour de 0,50 dollar, contre 19 dollars pour l’option de pointe la moins chère et 172 dollars pour la plus onéreuse. Un détail résume particulièrement bien le résultat : à chaque appel, les longues instructions optimisées alourdissaient définitivement la facture des jetons d’entrée de 28 à 55 %. Le savoir placé dans un prompt se loue à chaque requête. Le savoir appris s’achète une fois et reste inscrit dans les poids.

Pourquoi un petit modèle l’emporte-t-il ? Parce que la tâche n’est pas complexe, mais précise. Pour chaque fiche, un modèle généraliste repart de zéro : il ignore la taxonomie de la boutique et les valeurs d’attribut autorisées, puis doit tout reconstituer à partir du prompt. Fermisense précise sans détour les limites de la méthode. Le processus doit être exécuté assez souvent pour que son coût compte, et son résultat doit pouvoir être vérifié au moyen d’une règle ou d’une grille. Une décision qui ne peut que faire débat ne peut pas recevoir de note ; sans note, le modèle n’a rien sur quoi s’exercer. Autre réserve à garder en tête : Fermisense vend précisément ce type de conseil et a conçu son propre banc d’essai. Quant aux huit autres déploiements cités, de Bridgewater à Intercom et LinkedIn, leurs chiffres proviennent chaque fois des entreprises concernées.

Ce que cela signifie pour vous : Si l’IA vous semble être un service loué à trois groupes américains, voici un contre-exemple utile. La tendance pourrait favoriser des spécialistes bon marché plutôt qu’un cerveau géant chargé de tout faire. Il ne s’agit toutefois pas d’un projet de week-end : il a fallu bâtir un environnement simulé, définir une grille de notation et mener un véritable travail d’ingénierie. Si votre entreprise prend des milliers de fois par jour une décision répétitive dont la bonne réponse est vérifiable, la première question n’est pas nécessairement de savoir s’il faut affiner un modèle. Demandez-vous plutôt si vous payez aujourd’hui le prix d’un modèle de pointe pour un travail qui n’en exige pas les capacités.

Sources

Sources: https://fermisense.com/when-machines-take-the-wheel/

Article suivant

Un tribunal indien qualifie l’entraînement de l’IA d’« usage privé » : les éditeurs doivent lire les petites lignes

La Haute Cour de Delhi a refusé à l’agence ANI une injonction provisoire contre OpenAI. Selon elle, le stockage d’articles protégés pour entraîner ChatGPT relève probablement d’une exception d’usage loyal. Cette décision reste provisoire.

Illustration en risographie d’une balance posée sur un bureau, avec une liasse de journaux d’un côté et une pile de cartes perforées vierges de l’autre, à côté d’un tampon inutilisé