Training data
El conjunto de textos, imágenes y código del que aprende un modelo, y la parte que menos les gusta describir a los laboratorios.
Los datos de entrenamiento son todo lo que un modelo ha visto mientras se construía: páginas web, libros, repositorios de código, imágenes y transcripciones. El modelo no almacena esos archivos. Ajusta millones de números internos, sus pesos del modelo, hasta aprender a predecir lo que viene después en materiales parecidos. Todo lo que parece saber un modelo se remonta a sus datos de entrenamiento, y por eso sus puntos ciegos y sesgos suelen reflejar sus fuentes.
Es la capa menos transparente de la IA moderna. La mayoría de los laboratorios cuenta el tamaño de un modelo y sus resultados en las pruebas, pero no qué se utilizó para entrenarlo, en parte por razones de competencia y en parte porque las cuestiones de derechos de autor sobre el material recopilado siguen en los tribunales. Proyectos como OpenWALDO intentan cambiarlo creando corpus donde cada documento lleva una licencia y un origen.
-
Hollywood y el propietario de TikTok firmaron una tregua sobre los vídeos con IA, pero no en la parte que más importa
-
We Are Building an Invention Meant to Outgrow Its Inventors
-
Debian vota si la IA puede tocar su código
-
El fundador de Rocky Linux quiere abrir la única parte de la IA que nadie abre: los datos de entrenamiento
-
Los modelos pequeños leen libros antiguos mejor que los grandes y cuestan dos dólares por cada mil páginas
-
Un modelo abierto está ahora a meses, no años, detrás de la frontera. Sus pruebas de seguridad no lo son.
-
Karpathy convirtió un párrafo de Tolkien en una escena 3D por diez dólares y lo llamó un vibe check.
-
Un investigador deja OpenAI a los ocho meses porque apuesta por mejores datos, no por modelos más grandes
-
Google Lyria 3.5 permite arreglar una parte de una canción generada con IA sin rehacerla entera
-
La mayor asociación informática debate si debe abrir su biblioteca a la IA
-
Un tribunal indio considera el entrenamiento de IA «uso privado»: los editores deben leer la letra pequeña
-
Quién es quién: Black Forest Labs, el laboratorio alemán que está detrás de Photoshop y Canva
-
No todos creen la historia del agente rebelde de OpenAI, y merece la pena escuchar las dudas
-
Un modelo abierto alemán contenía respuestas de pruebas en sus datos de entrenamiento, y lo sabemos gracias a su apertura
-
Misma pregunta, respuesta distinta: Claude es más cálido en hindi y más riguroso en ruso
-
SensorFM de Google quiere ser un único cerebro de IA para todos los datos de salud de tu dispositivo
-
Por qué Databricks acaba de convertir un modelo chino de código abierto en su motor de programación diario
-
El gran informe anual de Stanford sobre la IA ya está aquí, y la brecha de confianza se amplía