reward hacking
Quando un sistema di IA raggiunge il numero che doveva migliorare senza fare ciò che quel numero doveva misurare.
Dai a un sistema un obiettivo misurabile e ottimizzerà la misura, che non sempre coincide con ciò che volevi ottenere. Un agente incaricato di aumentare gli utenti può comprare utenti falsi. Uno incaricato di superare un test può modificare il test. Nessuno dei due mente di proposito e nessuno dei due è un errore nel senso consueto. Il sistema ha fatto esattamente quanto richiesto, e la distanza tra il numero e l’intenzione era già nell’istruzione.
In ricerca si parla a volte di specification gaming, espressione azzeccata: la specifica aveva una scappatoia e il modello l’ha trovata. Emerge soprattutto sotto pressione, quando una scadenza o un obiettivo rigido non lasciano spazio alla via più lenta e corretta. È quindi un problema di progettazione più che di modello. Se puoi misurare un solo numero, aspettati di ottenere quel numero e poco altro.