Scansione comune
Un'organizzazione no-profit che copia gran parte del web pubblico dal 2007 e distribuisce l'archivio gratuitamente.
Common Crawl esegue un crawler attraverso il Web aperto e pubblica ciò che trova come archivio scaricabile gratuitamente risalente al 2007. Esiste in modo che ricercatori e piccole aziende possano studiare il Web su larga scala senza bisogno dell’infrastruttura di Google. L’archivio contiene miliardi di pagine e si arricchisce di una nuova istantanea ogni mese o due.
Se ti sei chiesto da dove provenga il testo per addestrare un modello linguistico, questa è gran parte della risposta. Quasi tutti i modelli principali dispongono di Common Crawl da qualche parte nei dati di addestramento, solitamente filtrati e puliti per primi. Ciò lo rende anche un utile metro di misura: quando i ricercatori vogliono sapere come sta cambiando il web stesso, ad esempio quanto di esso ora mostra segni di paternità dell’intelligenza artificiale, Common Crawl è il campione a cui rivolgersi.