WikiSkill di Google consente agli agenti IA di tenere un wiki dei propri errori
Un documento di ricerca di Google descrive gli agenti che annotano ciò che è andato storto, lo distillano in istruzioni riutilizzabili e migliorano notevolmente senza alcuna riqualificazione. Un modello 9B ha battuto uno 27B.
Un agente AI oggi ha la memoria di un pesce rosso. Esegue un compito, commette lo stesso errore commesso ieri, finisce e dimentica tutto. Un nuovo articolo di Google Research e Virginia Tech, pubblicato su arXiv il 27 agosto, propone una soluzione piacevolmente low-tech: lasciare che l’agente mantenga una wiki.
Il sistema si chiama WikiSkill e ha tre livelli. Il Raw Layer memorizza le tracce di esecuzione complete, ogni chiamata allo strumento e ogni risultato e non cambia mai. Il Wiki Layer distilla quella documentazione grezza in note strutturate, modelli di fallimento documentati da un lato e strategie che hanno funzionato dall’altro, crescendo ad ogni round. Lo Skill Layer contiene le istruzioni effettive che l’agente segue quando funziona, confezionate come moduli riutilizzabili chiamati Agent Skills. Se una nuova versione di un’abilità peggiora le prestazioni, è possibile ripristinarla. I numeri sono sostanziali: Gemini-3.5-Flash è passato dal 49,5% al 68,1% di precisione e Qwen-3.6-27B dal 39,4% al 63,3%. In un confronto, un modello 9B con WikiSkill ha sovraperformato un modello 27B senza di esso.
Cosa sta realmente succedendo qui: vale la pena essere precisi su ciò che si sta imparando qui, perché il linguaggio del marketing al riguardo diventa sfuggente. Il modello in sé non cambia. I suoi pesi, i numeri fissati durante l’allenamento, restano esattamente quelli di prima. Ciò che cambia sono le istruzioni scritte che l’agente legge prima di iniziare a funzionare. Questo è più vicino alla memoria esterna persistente e al miglioramento rapido automatizzato che a un modello che continua ad apprendere dopo il rilascio. Sembra un downgrade, ma è probabilmente migliore per l’uso pratico: le note sono leggibili, modificabili e reversibili, mentre la riqualificazione di un modello è costosa, lenta e opaca. Se vuoi sapere perché il tuo agente si comporta in un certo modo, puoi aprire il wiki e leggerlo. Questa è una storia di debug, non solo una storia di riferimento.
Che cosa significa per te: la lezione immediata è quella che puoi applicare manualmente oggi stesso, senza che sia richiesto alcun codice di ricerca. Se utilizzi un assistente AI per un’attività ricorrente, conserva un breve documento di ciò che ha funzionato e ciò che ha fallito e incollalo all’inizio di ogni sessione. Questo è WikiSkill in miniatura e l’effetto è reale. Diversi assistenti supportano già file di istruzioni o competenze salvate proprio per questo. Per chiunque si basi sugli agenti, la scoperta che vale la pena prendere sul serio è il confronto delle dimensioni: la conoscenza accumulata delle attività ha colmato un divario che altrimenti sarebbe costato un modello tre volte più grande, e i costi di gestione aumentano con le dimensioni. Un giusto avvertimento: questi risultati provengono dalle valutazioni degli stessi autori, e un sistema che scrive le proprie istruzioni può anche scrivere con una cattiva abitudine e poi seguirle fedelmente. Il livello di rollback esiste per un motivo.
Fonti
LAION pubblica 10 milioni di ore di video per la ricerca sull'intelligenza artificiale aperta
Il Big Video Dataset estrae 80 milioni di video da CommonCrawl, con didascalie scritte automaticamente sia per le immagini che per il suono. È esclusivamente di ricerca e la questione del copyright si trova proprio sotto di essa.