AMD entrena un modelo totalmente abierto con sus propios chips, pero sin licencia comercial
Instella-MoE-16B-A3B tiene 16.000 millones de parámetros, aunque solo activa 2.800 millones por token. AMD publicó pesos, datos y código; los pesos quedan limitados a la investigación.
AMD ha publicado Instella-MoE-16B-A3B, un modelo de lenguaje entrenado desde cero con sus aceleradores Instinct MI300X y MI325X. La cifra importante está en el reparto: suma 16.000 millones de parámetros, pero para cada palabra procesada solo se activan unos 2.800 millones.
Así funcionan los modelos de mezcla de expertos. Cada fragmento de entrada se dirige únicamente a unos pocos submodelos especializados, lo que permite reunir el conocimiento de un modelo grande con un coste de ejecución parecido al de uno pequeño. AMD declara una media de 76,7 puntos en sus pruebas, por delante de Moonlight-16B-A3B (76,2) y OLMo-3-7B (70,1); la versión de razonamiento “Think” alcanza 73,22 tras el ajuste posterior. Una variante controlada de la atención latente multicabezal y el sistema FarSkip-Collective habrían acelerado el entrenamiento un 12,7% y reducido un 39,2% el tiempo hasta el primer token. AMD publicó los pesos de todas las etapas, las mezclas de datos, la configuración y el código de inferencia. La limitación está en la licencia: los pesos usan ResearchRAIL y solo permiten investigación y uso académico, mientras que el código de entrenamiento es MIT. El modelo no puede incorporarse sin más a un producto comercial.
Qué hay detrás. La ventaja de Nvidia no depende solo del silicio, sino también de CUDA y de años de métodos de entrenamiento creados para ese ecosistema. AMD no puede cerrar la brecha con una ficha técnica; necesita demostrar en público que es posible entrenar de principio a fin un modelo competitivo con hardware AMD y ROCm. Los puntos de control intermedios y las mezclas de datos se dirigen a investigadores, que influyen en qué hardware admitirán las próximas herramientas. La licencia de investigación deja claro el objetivo: ganar credibilidad, no cuota de mercado con este modelo.
Qué significa esto para ti: lo más probable es que nunca uses Instella directamente. Su efecto indirecto importa más: un segundo proveedor creíble de hardware de entrenamiento es la vía más realista para aumentar la competencia y abaratar la IA. Para estudiantes e investigadores, poder examinar cada etapa del proceso, y no solo los pesos finales, sí representa una oportunidad poco habitual.
Fuentes
Fuentes: https://rocm.blogs.amd.com/artificial-intelligence/instella-moe/README.html
El número de chips de IA en el mundo se duplica aproximadamente cada nueve meses
Epoch AI calcula que hoy hay unos 20 millones de chips de IA en centros de datos y que serán cerca de 200 millones a finales de 2028. Es la cifra que explica buena parte de lo que viene.