Un’IA più piccola e personalizzata ha battuto GPT e Claude in un lavoro reale, a una frazione del costo
Un gigantesco hedge fund e una startup IA di primo piano hanno dimostrato che un modello gratuito e scaricabile, addestrato sul giudizio dei propri esperti, ha superato tutte le IA più note nelle attività finanziarie a circa un quattordicesimo del costo. La lezione vale ben oltre Wall Street.
Nel campo dell’IA, più grande non significa sempre migliore: ecco un esempio concreto. Bridgewater, uno dei maggiori hedge fund al mondo, ha collaborato con Thinking Machines Lab, una startup fondata dall’ex CTO di OpenAI Mira Murati, e ha dimostrato che un modello più piccolo e personalizzato ha battuto tutte le IA più note messe alla prova in un vero lavoro finanziario, costando al tempo stesso circa 14 volte meno.
Il compito era il lavoro quotidiano e poco affascinante di un analista degli investimenti: questo articolo di giornale è rilevante per noi? Questa dichiarazione di una banca centrale suggerisce future variazioni dei tassi d’interesse? Valutazioni semplici per un esperto umano e, a quanto pare, difficili per un’IA generalista. Senza modifiche, le versioni di Gemini, Claude e GPT hanno ottenuto un’accuratezza attorno al 50%. Istruzioni formulate con cura dagli esperti le hanno portate a metà della fascia del 70%, ancora al di sotto dell’80% che il team desiderava prima di fidarsi dei risultati. È significativo che modelli più nuovi e costosi abbiano aiutato pochissimo.
La soluzione è stata il fine-tuning: il processo con cui si prende un modello aperto esistente e lo si addestra ulteriormente su esempi provenienti dai propri esperti, affinché impari il tuo specifico criterio di giudizio invece di una conoscenza generica. Il team è partito da Qwen3 di Alibaba, disponibile gratuitamente, e lo ha addestrato sul modo in cui gli analisti prendono realmente queste decisioni, raggiungendo un’accuratezza dell’84,7% e superando ogni modello di frontiera. Un accorgimento intelligente per contenere i costi: anziché pagare esperti perché classificassero ogni elemento, hanno affidato a un primo modello una valutazione approssimativa, inviando poi agli esseri umani soltanto i casi di disaccordo. È come formare un nuovo dipendente brillante usando le decisioni dei tuoi collaboratori migliori, invece di sperare che un generalista geniale indovini lo stile della casa.
Una precisazione sincera: i risultati provengono dalla valutazione delle due stesse aziende, che vendono entrambe prodotti collegati; nessun soggetto indipendente ha verificato i numeri. La direzione, però, è coerente con ciò che continuano a scoprire altri team: l’IA generalista raggiunge un limite nelle attività che dipendono da un giudizio specialistico sviluppato internamente.
Cosa significa per te: I dati più preziosi della tua azienda sono probabilmente proprio quelli che non incolleresti mai in un chatbot pubblico. Questo è un segnale che quegli stessi dati potrebbero alimentare un’IA più piccola e privata, capace di battere i giganti nel tuo compito specifico. Non serve il budget di un hedge fund: lo schema consiste in un modello aperto di dimensioni contenute più una buona raccolta di esempi classificati dai tuoi esperti. Il fine-tuning significa inoltre che mantieni il controllo del modello e dei dati e, se vuoi, puoi eseguirlo sul tuo hardware, senza far uscire nulla dall’edificio.
Fonti
Fonti: https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/
Perché uno strumento di programmazione IA è finito nello scontro tra Stati Uniti e Cina, e che cosa ci insegna
Anthropic cerca di impedire alle aziende cinesi di usare Claude Code, mentre Alibaba vieta al proprio personale di utilizzarlo. Probabilmente non sei coinvolto in questo scontro, ma la domanda sottostante riguarda ogni impresa che usa strumenti IA nel cloud.