AMD achète Taalas, une startup qui intègre un modèle d'IA complet dans la puce
Taalas grave l'architecture et la pondération d'un modèle directement dans le silicium. Cela le rend extrêmement rapide et totalement rigide. AMD souhaite cette technologie aux côtés de ses GPU Instinct.
AMD achète Taalas, une petite startup canadienne de puces avec une idée inhabituelle : au lieu de construire une puce générale capable d’exécuter n’importe quel modèle d’IA, construisez une puce qui peut en exécuter exactement un, en gravant ce modèle directement dans le matériel. L’accord a été annoncé vendredi et est soumis aux approbations réglementaires habituelles.
Un peu de vocabulaire d’abord, car cela donne du sens au reste. Lorsqu’un modèle d’IA vous répond, cela s’appelle une inférence, par opposition à une formation, qui est le processus unique et coûteux de construction du modèle en premier lieu. L’inférence est ce qui se produit des millions de fois par jour, c’est donc là que se situe la majeure partie des coûts de fonctionnement. Normalement, un GPU charge les poids du modèle, les milliards de nombres qui codent ce que le modèle a appris, hors de la mémoire et fait le calcul. Mélanger ces chiffres dans les deux sens est une grande partie de ce qui le rend lent et gourmand en énergie.
Taalas saute cette étape en insérant l’architecture et les poids entraînés dans la puce elle-même. La société est sortie furtivement en février 2026 avec une puce de démonstration exécutant Llama 3.1-8B à plus de 16 000 jetons par seconde et par utilisateur, plusieurs fois plus rapide que le matériel d’inférence concurrent. Un jeton est à peu près un fragment de mot, ce nombre signifie donc que le texte apparaît beaucoup plus rapidement que quiconque ne peut le lire. Le problème est là dans la conception : cette puce exécute Llama 3.1-8B et rien d’autre, pour toujours. Nouveau modèle, nouveau silicium.
Ce commerce est moins étrange qu’il n’y paraît. La conception et la fabrication des puces prennent plusieurs mois et, jusqu’à récemment, un modèle était obsolète avant l’arrivée de sa puce. Maintenant que les modèles haut de gamme restent en service plus longtemps et que la même poignée d’entre eux desservent d’énormes volumes de trafic, le fait d’en verrouiller un dans le matériel commence à prendre de l’ampleur. Google travaillerait sur la même astuce avec une puce intégrée à l’architecture de Gemini. AMD affirme qu’il intégrera la technologie dans sa feuille de route d’accélérateur et la proposera aux côtés de ses GPU Instinct en tant que produit au niveau du système. Le chef d’AMD AI, Vamsi Boppana, a qualifié cela de renforcement du portefeuille, et le co-fondateur de Taalas, Ljubisa Bajic, a déclaré qu’AMD apportait l’ampleur qui manquait à la startup.
Ce que cela signifie pour vous: rien que vous puissiez acheter et rien qui change votre chatbot cette semaine. Ce qui changera au cours des prochaines années, c’est le prix. Les puces sous les services d’IA deviennent progressivement moins chères et plus efficaces par réponse, et c’est la principale raison pour laquelle les niveaux gratuits que vous utilisez continuent de devenir plus généreux plutôt que moins. C’est également un petit indice sur la direction que prend “l’IA sur votre propre appareil” : pas un cerveau à usage général dans votre téléphone, mais des modèles spécifiques fixés dans un matériel spécifique. Une mise en garde : il s’agit d’une acquisition, pas d’un produit. Les régulateurs doivent encore l’autoriser, et rien ne sera expédié demain.
Sources
ByteDance, propriétaire de TikTok, formerait le plus grand modèle d'IA de Chine à ce jour
Trois initiés ont déclaré au Financial Times que ByteDance dispose d'un modèle avec jusqu'à dix mille milliards de paramètres en pré-entraînement, soit trois fois la taille de Kimi K3.