Exploration commune
Une organisation à but non lucratif qui copie une grande partie du Web public depuis 2007 et distribue les archives gratuitement.
Common Crawl exécute un robot d’exploration sur le Web ouvert et publie ce qu’il trouve sous forme d’archives téléchargeables gratuitement depuis 2007. Il existe pour que les chercheurs et les petites entreprises puissent étudier le Web à grande échelle sans avoir besoin de l’infrastructure de Google. Les archives contiennent des milliards de pages et s’agrandissent d’un nouvel instantané tous les mois ou deux.
Si vous vous demandez d’où vient le texte permettant d’entraîner un modèle de langage, c’est une grande partie de la réponse. Presque tous les modèles majeurs ont Common Crawl quelque part dans leurs données de formation, généralement filtrées et nettoyées en premier. Cela en fait également un outil de mesure pratique : lorsque les chercheurs veulent savoir comment le Web lui-même évolue, par exemple dans quelle mesure il montre désormais des signes d’auteur de l’IA, Common Crawl est l’échantillon qu’ils recherchent.