Apprendimento per rinforzo
Un metodo di formazione in cui un modello viene premiato per i buoni tentativi piuttosto che per le risposte corrette.
L’apprendimento per rinforzo si allena attraverso prove, errori e ricompense. Invece di mostrare le risposte corrette da copiare, valuti le prove e sposti il modello verso risultati con premi più alti. Il recente salto di qualità nei Modelli di ragionamento deriva principalmente da questo, non da modelli più grandi.
Il metodo necessita di un segnale affidabile vero o falso. Il codice viene compilato o meno, le dimostrazioni matematiche sono corrette oppure no. Le e-mail discrete o le decisioni aziendali non dispongono di una valutazione automatica. Ecco perché i modelli appaiono disomogenei: la formazione è stata particolarmente intensa, il che è stato facile da valutare.
-
Guardare il proprio modello ora costa a OpenAI il 20% in più e ha sospeso un corso di formazione per farlo
-
OpenAI ha congelato la propria formazione per due settimane e ora osserva i suoi modelli come un falco
-
Google ha trasformato un modello finito in uno molto più veloce e ha pubblicato la ricetta
-
Qwen3.8-Max di Alibaba ha impiegato 16 giorni a scrivere uno strumento da solo e i pesi verranno resi pubblici la prossima settimana
-
Un addestramento da 500 dollari fa superare a un modello 9B tutti i modelli di punta in un compito ripetitivo
-
Un vincitore del premio Turing scommette contro il deep learning con la nuova startup Oak Lab
-
Mistral entra nella robotica: basta una videocamera per guidare un robot