Mezcla de expertos
Un diseño de modelos en el que solo se ejecuta una pequeña parte de la red para cada solicitud, lo que abarata el uso de modelos grandes.
En un modelo de mezcla de expertos, la red se divide en muchas subredes y un enrutador elige solo unas pocas para cada entrada. Por eso estos modelos se describen con dos cifras, por ejemplo 284.000 millones de parámetros totales y 13.000 millones activos. La primera indica el tamaño completo; la segunda, la parte que se ejecuta cada vez.
El efecto práctico es que obtienes el conocimiento de un modelo muy grande con un coste de ejecución más próximo al de uno pequeño. Casi todos los modelos abiertos recientes, desde DeepSeek hasta Inkling de Thinking Machines, utilizan este diseño. El inconveniente tradicional era la memoria, porque seguía siendo necesario cargar el modelo completo aunque solo se usara una parte. Sistemas como Swiftlet reducen ese problema al cargar desde el disco los expertos inactivos cuando hacen falta.
-
¿Empeoran los modelos en datos a propósito?
-
El nuevo modelo gratuito de Nvidia no es el más inteligente. Es muy, muy rápido
-
Un modelo de 80 mil millones de parámetros ahora se ejecuta en una Mac normal con 4,3 GB de memoria y uno de 35 mil millones de parámetros se ejecuta en un iPhone.
-
AMD entrena un modelo totalmente abierto con sus propios chips, pero sin licencia comercial
-
El laboratorio de Mira Murati reduce su modelo a menos de un tercio y solo pierde un punto
-
Los pesos de Kimi K3 ya son públicos, y ocupan 1,4 terabytes
-
Ollama mejora discretamente los Mac para ejecutar modelos abiertos
-
DeepSeek V4 ya es totalmente estable y los modelos antiguos se apagan hoy
-
Un pequeño modelo abierto de programación acaba de superar a rivales diez veces mayores, y puedes ejecutarlo tú mismo
-
El nuevo laboratorio de Mira Murati presenta su primer modelo, concebido para personalizarse
-
Soofi S: Alemania ya tiene un modelo abierto que lidera las clasificaciones de código abierto