CourionAI
FR
Newsletter
← Toutes les actus
open-weights 1 min de lecture

AMD entraîne un modèle entièrement ouvert sur ses propres puces, mais réserve les poids à la recherche

Instella-MoE-16B-A3B compte 16 milliards de paramètres mais n’en active que 2,8 milliards par jeton. AMD publie les poids de chaque étape, les mélanges de données et le code, sans licence commerciale.

Une armoire en bois à seize tiroirs dont trois seulement sont ouverts et éclairés, avec ailettes, câbles et plan déplié

AMD publie Instella-MoE-16B-A3B, entraîné de zéro sur ses accélérateurs Instinct MI300X et MI325X. Le modèle compte 16 milliards de paramètres, mais environ 2,8 milliards seulement travaillent pour chaque mot traité.

Cette architecture en mélange d’experts dirige chaque entrée vers quelques sous-réseaux spécialisés. Elle offre les connaissances d’un grand modèle au coût d’un petit. AMD annonce 76,7 points en moyenne pour la base, devant Moonlight-16B-A3B (76,2) et OLMo-3-7B (70,1) ; la version de raisonnement « Think » atteint 73,22 après post-entraînement. Une variante contrôlée de l’attention latente multi-tête et FarSkip-Collective accéléreraient l’entraînement de 12,7 % et réduiraient de 39,2 % le délai avant le premier jeton. Poids intermédiaires, mélanges de données, configuration et code d’inférence sont publics. Les poids sous ResearchRAIL restent toutefois réservés à la recherche, tandis que le code est sous MIT : impossible d’intégrer directement le modèle à un produit.

Ce qui se joue. L’avance de Nvidia tient autant à CUDA et aux recettes d’entraînement conçues pour lui qu’au silicium. AMD veut démontrer publiquement qu’un modèle compétitif peut être entraîné intégralement sur ses puces avec ROCm. Les checkpoints et données visent les chercheurs qui choisiront le matériel supporté par les prochains outils. La licence révèle l’objectif : gagner en crédibilité, pas des parts de marché pour ce modèle.

Ce que cela signifie pour vous : Vous n’utiliserez probablement pas Instella. Sa portée indirecte est plus grande : un deuxième fournisseur crédible de matériel d’entraînement est le meilleur levier pour faire baisser les prix de l’IA. Pour les chercheurs et étudiants, pouvoir inspecter toutes les étapes, et pas seulement les poids finaux, est exceptionnellement utile.

Sources

Sources: https://rocm.blogs.amd.com/artificial-intelligence/instella-moe/README.html

Article suivant

Le nombre de puces d’IA dans le monde double environ tous les neuf mois

Epoch AI estime à 20 millions le nombre de puces d’IA dans les centres de données et en prévoit près de 200 millions fin 2028. Ce chiffre explique une grande partie de la suite.

Deux rangées de baies de serveurs s’étendent vers l’horizon, leurs câbles convergeant vers un pylône lointain sous un ciel immense