CourionAI
FR
Newsletter
← Toutes les actus
open-source 3 min de lecture

Une petite IA sur mesure a battu GPT et Claude dans un vrai métier, pour une fraction du coût

Un fonds spéculatif géant et une jeune pousse de premier plan ont montré qu’un modèle gratuit et téléchargeable, entraîné à reproduire le jugement de leurs propres experts, surpassait toutes les grandes IA sur des tâches financières, pour un coût environ quatorze fois inférieur. La leçon dépasse largement Wall Street.

Illustration en risographie : un petit engrenage corail surpasse d’immenses engrenages gris sur un graphique, un petit modèle sur mesure bat les géants

En matière d’IA, le plus gros n’est pas toujours le meilleur, en voici une illustration concrète. Bridgewater, l’un des plus grands fonds spéculatifs au monde, s’est associé à Thinking Machines Lab, la jeune pousse fondée par Mira Murati, ancienne directrice technique d’OpenAI. Ensemble, ils ont montré qu’un modèle plus petit et personnalisé surpassait toutes les grandes IA testées sur une véritable tâche financière, tout en coûtant environ 14 fois moins cher à faire fonctionner.

La mission relevait du travail quotidien peu prestigieux d’un analyste financier : cet article de presse est-il pertinent pour nous ? Cette déclaration d’une banque centrale laisse-t-elle entrevoir de futurs mouvements de taux d’intérêt ? Des décisions simples pour un spécialiste humain, et, manifestement, difficiles pour une IA généraliste. Sans adaptation, plusieurs versions de Gemini, Claude et GPT ont obtenu une précision d’environ 50 %. Des instructions soigneusement rédigées par des experts les ont hissées autour de 75 %, toujours en dessous des 80 % que l’équipe souhaitait atteindre avant de faire confiance aux résultats. Fait notable, les modèles plus récents et plus coûteux n’ont apporté quasiment aucun progrès.

La solution a été l’ajustement fin, le procédé qui consiste à reprendre un modèle ouvert existant et à poursuivre son entraînement sur des exemples fournis par vos propres experts, afin qu’il apprenne votre jugement particulier plutôt que des connaissances génériques. L’équipe est partie de Qwen3, le modèle librement accessible d’Alibaba, l’a entraîné sur la façon dont ses analystes prennent réellement ces décisions et a atteint une précision de 84,7 %, mieux que tous les modèles de pointe. Une astuce ingénieuse a permis de réduire les coûts : au lieu de payer des spécialistes pour étiqueter toutes les données, l’équipe a demandé à un premier modèle d’effectuer un tri approximatif, puis n’a transmis aux humains que les cas de désaccord. C’est un peu comme former une nouvelle recrue brillante à partir des décisions de vos meilleurs employés, plutôt que d’espérer qu’un généraliste de génie devine la méthode maison.

Une réserve honnête : les résultats proviennent de l’évaluation menée par les deux entreprises elles-mêmes, qui vendent toutes deux des produits liés à cette approche, aucune partie indépendante n’a vérifié les chiffres. Mais la tendance rejoint ce que constatent sans cesse d’autres équipes : l’IA généraliste atteint ses limites sur les tâches qui reposent sur un jugement spécialisé propre à l’entreprise.

Ce que cela signifie pour vous : Les données les plus précieuses de votre entreprise sont probablement celles que vous ne colleriez jamais dans un chatbot public, et cette expérience indique que ces mêmes données pourraient alimenter une petite IA privée capable de battre les géants sur votre tâche précise. Nul besoin du budget d’un fonds spéculatif : la recette combine un modèle ouvert de taille modeste et un bon ensemble d’exemples étiquetés par vos propres experts. L’ajustement fin signifie aussi que vous conservez le modèle et les données et que vous pouvez, si vous le souhaitez, exécuter le tout sur votre propre matériel, sans que rien ne quitte les locaux.

Sources

Sources: https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/

Article suivant

Pourquoi un outil de programmation par IA s’est retrouvé au cœur du bras de fer entre les États-Unis et la Chine, et ce qu’il nous apprend

Anthropic tente d’empêcher les entreprises chinoises d’utiliser son outil Claude Code, tandis qu’Alibaba en interdit l’usage à son propre personnel. Vous n’êtes probablement pas pris dans ce conflit, mais la question sous-jacente concerne toutes les entreprises qui utilisent des outils d’IA dans le cloud.

Illustration en risographie : un outil de programmation est pris entre deux masses terrestres séparées par une barrière corail, un outil de développement bloqué des deux côtés