Un modello aperto tedesco aveva le risposte dei test nei dati di addestramento, e lo sappiamo grazie alla sua apertura
Il consorzio dietro Soofi S ha ammesso che alcune domande del benchmark scientifico GPQA erano finite nel set di addestramento. La comunità se n’è accorta perché i dati erano pubblici. Il team ha eliminato il benchmark e ricalcolato tutti i risultati.
Soofi S è un modello linguistico aperto da 30 miliardi di parametri, costruito da un consorzio di ricerca tedesco e addestrato sul cloud di Deutsche Telekom a Monaco. Al lancio, a metà luglio, rivendicava il primo posto tra i modelli completamente aperti nei test sia in tedesco sia in inglese. Nella versione 3.0 del rapporto tecnico, pubblicata questa settimana, il team ha ora ammesso che alcuni di quei test erano compromessi: domande di GPQA, un benchmark scientifico, erano finite nei dati di addestramento.
La causa è quasi banalmente ordinaria, ed è proprio questo a renderla istruttiva. Su Hugging Face, GPQA non ha una sezione separata per l’addestramento. Tutto il materiale di test si trova sotto l’etichetta predefinita «train». La pipeline dei dati del consorzio selezionava il materiale in base al nome della sezione, perciò, quando ha importato quelle che credeva domande di esercitazione, ha importato l’esame. Il dataset interessato avrebbe dovuto contenere soltanto versioni riformulate delle sezioni di addestramento di 25 benchmark standard.
Perché è importante? Un benchmark è utile solo se il modello non ha visto le risposte. Quando le domande dei test finiscono nei dati di addestramento, il modello può ottenere un buon punteggio ricordando anziché ragionando, e il numero smette di misurare le capacità. I ricercatori chiamano il fenomeno contaminazione ed è una delle ragioni meno evidenti per diffidare in generale delle classifiche. Di solito non viene scoperta, perché la maggior parte dei modelli è addestrata su dati che nessuno al di fuori del laboratorio può esaminare.
È questa la parte della storia su cui vale la pena soffermarsi. Nessuno nel consorzio aveva individuato l’errore. Lo ha scoperto la comunità leggendo i dati di addestramento pubblicati, accessibili perché il progetto si era impegnato a questo livello di trasparenza. Soofi S viene distribuito con i pesi del modello, i checkpoint intermedi, il codice di addestramento e valutazione e un inventario dettagliato di ogni fonte di dati, comprese quelle esaminate e scartate. La risposta è stata eliminare completamente GPQA dalla valutazione e ricalcolare i risultati di tutti i 16 modelli confrontati, così da mantenere equo il paragone. Secondo gli autori, l’ordine della classifica non è cambiato.
Una precisazione è doverosa in entrambe le direzioni. È una figuraccia e significa che i numeri del lancio originale erano sbagliati. Ma dimostra anche che l’approccio aperto fa ciò che promette: gli errori emergono, vengono nominati e corretti in pubblico. Un modello chiuso con lo stesso sbaglio manterrebbe semplicemente il punteggio. Lo stesso rapporto aveva già attraversato un primo dibattito pubblico, quando alcuni critici avevano sostenuto che il modello fosse stato addestrato con molti più dati di quanto suggeriscano le classiche regole di scaling, e il team aveva risposto spiegando le proprie ragioni anziché tacere.
Cosa significa per te: Due conclusioni pratiche. Primo, quando vedete un modello in cima a una classifica, ricordate che il punteggio è un’affermazione, non una misurazione, a meno che qualcuno possa controllare i dati di addestramento. Secondo, se per voi è importante verificare ciò che usate, l’apertura non è soltanto una preferenza ideologica: è il meccanismo che ha prodotto questa correzione. Nell’uso quotidiano non cambia nulla: Soofi S resta un valido modello aperto incentrato sul tedesco e la sua posizione in classifica è sopravvissuta al ricalcolo.
Fonti
Fonti: https://huggingface.co/spaces/Soofi-Project/Pretraining-Tech-Report
Ora i difensori usano la prompt injection come trappola per gli attaccanti basati sull’IA
Tracebit ha nascosto brevi stringhe in false risorse cloud per attivare le regole di sicurezza dello stesso modello di IA attaccante. Nei test, una sola stringa ha impedito ogni volta a Claude Opus 4.8 di ottenere l’accesso amministrativo.