Se informa que el propietario de TikTok, ByteDance, está entrenando el modelo de inteligencia artificial más grande de China hasta el momento
Tres expertos dijeron al Financial Times que ByteDance tiene un modelo con hasta diez billones de parámetros en preentrenamiento, tres veces el tamaño de Kimi K3.
ByteDance, la empresa detrás de TikTok, está entrenando un modelo de IA con hasta diez billones de parámetros, según un informe del Financial Times que cita a tres personas familiarizadas con el trabajo. Si el número se mantiene, sería aproximadamente tres veces el tamaño del Kimi K3 de Moonshot, actualmente el modelo chino más grande, y colocaría a ByteDance en la misma categoría de peso que el Mythos 5 de Anthropic, que la industria estima que ronda los ocho billones. Anthropic nunca ha publicado su propia figura.
Los parámetros son los números ajustables dentro de un modelo, las configuraciones que ajusta durante el entrenamiento para codificar lo que ha aprendido. Más parámetros significan más espacio para almacenar patrones, por lo que el recuento es un indicador aproximado de la capacidad. Duro es la palabra clave. La calidad de los datos, el método de entrenamiento y la duración del entrenamiento del modelo son al menos igual de importantes, y la industria ha visto repetidamente que modelos más pequeños y mejor entrenados superan a los más grandes y descuidados. Trate los recuentos de parámetros de la misma manera que trataría el tamaño del motor en un automóvil: informativo, no decisivo.
Según se informa, el modelo se encuentra en preentrenamiento, la primera fase y la que requiere más computación, donde trabaja con enormes cantidades de texto antes de que se realice cualquier ajuste. Esa fase suele durar de tres a seis meses, por lo que su lanzamiento estaría aún lejos. Una fuente agregó un detalle que vale la pena señalar: ByteDance ha evitado la destilación durante más de un año. La destilación significa entrenar su modelo con los resultados del modelo de otra persona, un atajo que le brinda una calidad decente a bajo costo y se ha convertido en un punto delicado entre los laboratorios. Elegir no usarlo es una afirmación de que se está haciendo lo costoso correctamente, aunque es una afirmación de una fuente anónima y no un hecho publicado.
El panorama más amplio es un retorno de la escala bruta como palanca competitiva. Según se informa, el fundador Zhang Yiming le dijo al equipo Seed de 2000 personas de ByteDance que apuntara a capacidades de modelo líderes en el mundo a largo plazo. Elon Musk dice que xAI está entrenando variantes de Grok en seis y diez billones de parámetros en su grupo Colossus 2. Después de un par de años en los que la eficiencia y la formación inteligente estaban de moda, varios laboratorios apuestan una vez más a que lo más grande, a un coste enorme, sigue ganando.
Qué significa esto para ti: por ahora no hay ninguna consecuencia práctica. El modelo no existe como producto, quizá nunca salga de China y, si lo hiciera, afrontaría cuestiones regulatorias y de exportación en la UE. Sirve para calibrar expectativas. La próxima vez que leas que un modelo tiene una cantidad asombrosa de parámetros, recuerda que esa cifra describe capacidad, no calidad. La pregunta interesante es con qué datos se entrenó y de qué manera. Si sigues los modelos de open weights, presta atención a este caso: ByteDance ya ha publicado pesos y un laboratorio chino con diez billones de parámetros cambiaría las expectativas de todo el sector.
Fuentes
Fuentes: https://www.ft.com/content/9b8383b1-a28d-4940-8c4e-2f0cd21556ef
Un desarrollador de OpenAI dice que ahora sería un buen momento para limpiar sus contraseñas expuestas
La advertencia es contundente: cualquier cosa sensible que se encuentre en público en GitHub o Pastebin está a punto de ser encontrada mucho más rápido, porque los modelos son lo suficientemente baratos como para buscarlos en todas partes a la vez.