rastreo común
Una organización sin fines de lucro que copia gran parte de la web pública desde 2007 y regala el archivo.
Common Crawl ejecuta un rastreador en la web abierta y publica lo que encuentra como un archivo descargable gratuito que se remonta a 2007. Existe para que los investigadores y las pequeñas empresas puedan estudiar la web a escala sin necesidad de la infraestructura de Google. El archivo contiene miles de millones de páginas y crece con una nueva instantánea cada mes o dos.
Si te has preguntado de dónde viene el texto para entrenar un modelo de lenguaje, esta es gran parte de la respuesta. Casi todos los modelos principales tienen Common Crawl en algún lugar de sus datos de entrenamiento, generalmente filtrados y limpiados primero. Eso también lo convierte en una útil vara de medir: cuando los investigadores quieren saber cómo está cambiando la propia web, por ejemplo, cuánto de ella muestra ahora signos de autoría de IA, Common Crawl es la muestra que buscan.