CourionAI
FR
Newsletter
← Toutes les actus
open-weights 3 min de lecture

Quelqu'un a fait fonctionner DeepSeek V4 Flash en production sur une seule carte AMD et a publié tous les correctifs nécessaires

Un référentiel public documente la configuration, les correctifs et les réglages nécessaires pour servir DeepSeek V4 Flash sur un AMD MI300X, non quantifié. C'est un enregistrement utile de la quantité de travail qui reste à exécuter un modèle ouvert sur du matériel non Nvidia.

Une seule puce informatique sur un établi entourée de clés, de cales et de joints coupés à la main

DeepSeek a publié les poids pour V4 Flash le 31 juillet sous licence MIT, ce qui signifie que tout le monde peut les télécharger et les exécuter. Un référentiel publié cette semaine montre ce que coûte « n’importe qui peut l’exécuter » dans la pratique : l’ensemble complet de fichiers de configuration, de correctifs et de tables de réglage dont un ingénieur avait besoin pour servir le modèle de manière fiable sur une seule carte AMD MI300X, en production, avec la précision d’origine du point de contrôle, sans compression supplémentaire ni déchargement vers la mémoire système.

Le référentiel est exceptionnellement honnête sur le travail impliqué. Il répertorie la pile Docker Compose, les superpositions de fichiers épinglées par leurs sommes de contrôle SHA-256 afin que rien ne dérive, les différences de référence par rapport aux projets en amont et les tables de réglage. Les correctifs couvrent le format numérique FP8 du modèle, le routage expert sous haute concurrence, la vérification spéculative causale, la synchronisation entre la mémoire CPU et GPU et plusieurs formes de noyau que personne n’avait réglées pour cette carte. Les rapports de bogues associés dans les projets vLLM et SGLang montrent les mêmes aspérités dans l’autre sens, y compris une version vLLM dont les notes affirmaient un support AMD qui n’a pas résisté sur le nouveau MI350X.

Qu’est-ce qui se cache derrière cela. Le véritable avantage de Nvidia n’a jamais été seulement le silicium, mais bien CUDA, la couche logicielle sur laquelle tout ce qui concerne l’IA est écrit. L’équivalent d’AMD, ROCm, s’est beaucoup amélioré, mais « les pondérations sont ouvertes » et « les pondérations exécutées sur votre matériel » restent des affirmations différentes, et le vide est comblé précisément par ce type d’ingénierie peu glamour. Le publier est plus important qu’il n’y paraît : les correctifs épinglés et les configurations reproductibles sont la façon dont une expérience héroïque unique se transforme en quelque chose que la personne suivante peut copier en un après-midi. Chacun de ces référentiels rend le deuxième fournisseur de GPU légèrement plus viable, ce qui est la seule chose qui exerce une pression à la baisse sur les prix de calcul.

Ce que cela signifie pour vous: si vous louez des GPU ou effectuez de l’inference pour un produit, les cartes AMD sont généralement moins chères par unité de mémoire et il s’agit d’un point de données concret sur ce qu’il faut pour les utiliser, y compris les modes de défaillance auxquels s’attendre. Si vous ne le faites pas, l’histoire vaut toujours la peine d’être connue comme toile de fond. Aujourd’hui, presque tout le coût de l’IA est dû aux puces et à la pile logicielle d’une entreprise, et tout ce qui érode cette dépendance finit par se refléter dans le prix que vous payez pour un abonnement. Il convient cependant de garder les attentes fondées : il s’agit d’une configuration d’un ingénieur pour une carte et un modèle, et non d’une promesse générale selon laquelle les open weights fonctionnent n’importe où.

Sources

Sources: https://github.com/ryanzhou/deepseek-v4-flash-mi300x

Article suivant

Des chercheurs ont demandé pourquoi les chatbots sont mauvais avec les feuilles de calcul, et la réponse est plus étrange que prévu

Un nouvel article teste cinq explications expliquant pourquoi les grands modèles de langage perdent face aux méthodes de prédiction tabulaire vieilles de plusieurs décennies. En faibles dimensions, le modèle se comporte comme un simple classificateur basé sur la distance. Dans les dimensions supérieures, rien de classique ne l'explique.

Un bras robotique laissant tomber des perles sur une grille vide tandis qu'un simple boulier en bois à côté se trouve parfaitement résolu