Gemeinsames Kriechen
Eine gemeinnützige Organisation, die seit 2007 große Teile des öffentlichen Webs kopiert und das Archiv kostenlos zur Verfügung stellt.
Common Crawl führt einen Crawler durch das offene Web und veröffentlicht die Ergebnisse als kostenloses, herunterladbares Archiv aus dem Jahr 2007. Es existiert, damit Forscher und kleine Unternehmen das Web in großem Maßstab untersuchen können, ohne die Infrastruktur von Google zu benötigen. Das Archiv umfasst Milliarden von Seiten und wächst alle ein bis zwei Monate um einen neuen Schnappschuss.
Wenn Sie sich gefragt haben, woher der Text zum Trainieren eines Sprachmodells kommt, ist dies ein großer Teil der Antwort. Fast jedes große Modell hat irgendwo in seinen Trainingsdaten Common Crawl, das normalerweise zuerst gefiltert und bereinigt wird. Das macht es auch zu einem praktischen Maßstab: Wenn Forscher wissen wollen, wie sich das Web selbst verändert, zum Beispiel, wie viel davon mittlerweile Anzeichen von KI-Urheberschaft aufweist, ist Common Crawl die Stichprobe, nach der sie greifen.