Destilación
Entrenar un modelo más pequeño con las respuestas de uno grande para que copie su comportamiento de forma barata.
Construir un modelo puntero desde cero cuesta una fortuna. La destilación es el atajo: se toma un modelo existente y caro, se le hacen cantidades enormes de preguntas y se entrena un modelo nuevo y más pequeño con sus respuestas. El modelo pequeño nunca ve los datos de entrenamiento originales ni los pesos, solo las salidas, pero recoge una cantidad sorprendente del comportamiento. El resultado es un modelo mucho más barato de construir y de ejecutar, a cambio de algo de calidad.
Hecho dentro de una misma empresa, es práctica habitual y es como se fabrican la mayoría de los modelos pequeños y rápidos que usted usa. Hecho entre empresas, se vuelve polémico enseguida, porque significa que un laboratorio puede absorber el trabajo caro de un rival a través de su interfaz pública. Hoy casi todos los proveedores lo prohíben en sus condiciones de uso, varios han acusado a competidores de hacerlo igualmente, y los laboratorios que lo evitan suelen decirlo bien alto.
-
Los investigadores encontraron una manera de leer los pensamientos ocultos de Claude, ChatGPT y Gemini
-
Google convirtió un modelo terminado en uno mucho más rápido y publicó la receta
-
Se informa que el propietario de TikTok, ByteDance, está entrenando el modelo de inteligencia artificial más grande de China hasta el momento
-
Los pesos de Kimi K3 ya son públicos, y ocupan 1,4 terabytes
-
Nadella: pagas dos veces por la IA, una con dinero y otra con tus conocimientos
-
Donde termina la red, comienza la pequeña IA: modelos diminutos salvan vidas sin conexión