CourionAI
IT
Newsletter
← Glossario Termine

Training data

La massa di testi, immagini e codice da cui un modello impara, e la parte che i laboratori descrivono meno volentieri.

I dati di addestramento sono tutto ciò che un modello ha visto mentre veniva costruito: pagine web, libri, repository di codice, immagini e trascrizioni. Il modello non conserva questi file. Modifica milioni di numeri interni, i suoi pesi del modello, finché diventa bravo a prevedere ciò che viene dopo in materiali simili. Tutto ciò che un modello sembra sapere risale ai dati su cui è stato addestrato, motivo per cui anche lacune e distorsioni tendono a rifletterne le fonti.

È il livello meno trasparente dell’IA moderna. La maggior parte dei laboratori dice quanto è grande un modello e come va nei benchmark, ma non cosa lo abbia alimentato, in parte per ragioni competitive e in parte perché le questioni di copyright sui contenuti raccolti online sono ancora nei tribunali. Progetti come OpenWALDO provano a cambiare le cose creando corpus in cui ogni documento porta una licenza e un’origine.