Training data
La massa di testi, immagini e codice da cui un modello impara, e la parte che i laboratori descrivono meno volentieri.
I dati di addestramento sono tutto ciò che un modello ha visto mentre veniva costruito: pagine web, libri, repository di codice, immagini e trascrizioni. Il modello non conserva questi file. Modifica milioni di numeri interni, i suoi pesi del modello, finché diventa bravo a prevedere ciò che viene dopo in materiali simili. Tutto ciò che un modello sembra sapere risale ai dati su cui è stato addestrato, motivo per cui anche lacune e distorsioni tendono a rifletterne le fonti.
È il livello meno trasparente dell’IA moderna. La maggior parte dei laboratori dice quanto è grande un modello e come va nei benchmark, ma non cosa lo abbia alimentato, in parte per ragioni competitive e in parte perché le questioni di copyright sui contenuti raccolti online sono ancora nei tribunali. Progetti come OpenWALDO provano a cambiare le cose creando corpus in cui ogni documento porta una licenza e un’origine.
-
Hollywood e il proprietario di TikTok hanno firmato una tregua sui video AI, ma non sulla parte che conta di più
-
We Are Building an Invention Meant to Outgrow Its Inventors
-
Debian vota se l'IA possa toccare il suo codice
-
Il fondatore di Rocky Linux vuole aprire la parte più segreta dell'IA: i dati di addestramento
-
I modelli piccoli leggono i vecchi libri meglio di quelli grandi, e costa due dollari per mille pagine
-
Un modello aperto è ormai mesi, non anni, indietro rispetto alla frontiera. I suoi test di sicurezza non lo sono.
-
Karpathy ha trasformato un paragrafo di Tolkien in una scena 3D per dieci dollari e l'ha definito un vibe check
-
Un ricercatore lascia OpenAI dopo otto mesi: scommette sui dati migliori, non sui modelli più grandi
-
Con Google Lyria 3.5 puoi correggere una parte di una canzone IA senza rifare tutto
-
La maggiore associazione informatica valuta se aprire la sua biblioteca all’IA
-
Un tribunale indiano considera l’addestramento dell’IA un «uso privato»: gli editori leggano le clausole
-
Chi è chi: Black Forest Labs, il laboratorio tedesco dentro Photoshop e Canva
-
Non tutti credono alla storia dell’agente ribelle di OpenAI, e vale la pena ascoltare i dubbi
-
Un modello aperto tedesco aveva le risposte dei test nei dati di addestramento, e lo sappiamo grazie alla sua apertura
-
Un attacco informatico ha svelato i dati di addestramento di un generatore musicale di IA: due milioni di clip da YouTube
-
Stessa domanda, risposta diversa: Claude è più caloroso in hindi e più rigoroso in russo
-
SensorFM di Google vuole essere un unico cervello IA per tutti i dati sanitari del tuo dispositivo indossabile
-
Perché Databricks ha scelto un modello open source cinese come motore quotidiano per la programmazione
-
È uscita la grande pagella annuale sull'IA di Stanford e il divario di fiducia aumenta