Un’IA più piccola e personalizzata ha battuto GPT e Claude in un lavoro reale, a una frazione del costo
Un gigantesco hedge fund e una startup IA di primo piano hanno dimostrato che un modello gratuito e scaricabile, addestrato sul giudizio dei propri esperti, ha superato tutte le IA più note nelle attività finanziarie a circa un quattordicesimo del costo. La lezione vale ben oltre Wall Street.
Nel campo dell’IA, più grande non significa sempre migliore: ecco un esempio concreto. Bridgewater, uno dei maggiori hedge fund al mondo, ha collaborato con Thinking Machines Lab, una startup fondata dall’ex CTO di OpenAI Mira Murati, e ha dimostrato che un modello più piccolo e personalizzato ha battuto tutte le IA più note messe alla prova in un vero lavoro finanziario, costando al tempo stesso circa 14 volte meno.
Il compito era il lavoro quotidiano e poco affascinante di un analista degli investimenti: questo articolo di giornale è rilevante per noi? Questa dichiarazione di una banca centrale suggerisce future variazioni dei tassi d’interesse? Valutazioni semplici per un esperto umano e, a quanto pare, difficili per un’IA generalista. Senza modifiche, le versioni di Gemini, Claude e GPT hanno ottenuto un’accuratezza attorno al 50%. Istruzioni formulate con cura dagli esperti le hanno portate a metà della fascia del 70%, ancora al di sotto dell’80% che il team desiderava prima di fidarsi dei risultati. È significativo che modelli più nuovi e costosi abbiano aiutato pochissimo.
La soluzione è stata il fine-tuning: il processo con cui si prende un modello aperto esistente e lo si addestra ulteriormente su esempi provenienti dai propri esperti, affinché impari il tuo specifico criterio di giudizio invece di una conoscenza generica. Il team è partito da Qwen3 di Alibaba, disponibile gratuitamente, e lo ha addestrato sul modo in cui gli analisti prendono realmente queste decisioni, raggiungendo un’accuratezza dell’84,7% e superando ogni modello di frontiera. Un accorgimento intelligente per contenere i costi: anziché pagare esperti perché classificassero ogni elemento, hanno affidato a un primo modello una valutazione approssimativa, inviando poi agli esseri umani soltanto i casi di disaccordo. È come formare un nuovo dipendente brillante usando le decisioni dei tuoi collaboratori migliori, invece di sperare che un generalista geniale indovini lo stile della casa.
Una precisazione sincera: i risultati provengono dalla valutazione delle due stesse aziende, che vendono entrambe prodotti collegati; nessun soggetto indipendente ha verificato i numeri. La direzione, però, è coerente con ciò che continuano a scoprire altri team: l’IA generalista raggiunge un limite nelle attività che dipendono da un giudizio specialistico sviluppato internamente.
Cosa significa per te: I dati più preziosi della tua azienda sono probabilmente proprio quelli che non incolleresti mai in un chatbot pubblico. Questo è un segnale che quegli stessi dati potrebbero alimentare un’IA più piccola e privata, capace di battere i giganti nel tuo compito specifico. Non serve il budget di un hedge fund: lo schema consiste in un modello aperto di dimensioni contenute più una buona raccolta di esempi classificati dai tuoi esperti. Il fine-tuning significa inoltre che mantieni il controllo del modello e dei dati e, se vuoi, puoi eseguirlo sul tuo hardware, senza far uscire nulla dall’edificio.
Fonti
Fonti: https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/
Tesla ha limitato a 200 dollari a settimana la spesa dei dipendenti per l’IA: il segnale di una fattura inattesa
Gli ingegneri di Tesla spendevano migliaia di dollari alla settimana in strumenti IA, così l’azienda ha fissato un limite settimanale di 200 dollari. È un caso estremo di un problema che si diffonde silenziosamente in ogni impresa che ha detto al personale di «usare più IA». Ecco il numero che serve alla tua azienda.