← Glossario Termine
Jacobian Lens
Un metodo di ricerca di Anthropic per leggere la memoria di lavoro nascosta di un modello.
La Jacobian Lens (J-Lens) è un metodo di interpretabilità sviluppato da Anthropic. Mappa una «memoria di lavoro» nascosta dentro Claude, chiamata J-Space, nella quale il modello conserva concetti che non esprime mai ad alta voce; modificando quei concetti nascosti cambiano anche le risposte del modello.
La ricerca sull’interpretabilità è importante perché trasforma l’IA da scatola nera in qualcosa che possiamo ispezionare, un requisito necessario per affidarle lavori importanti.
Citato in