DeepSeek ouvre un modèle de 305 milliards de paramètres qui permet enfin de voir
DeepSeek-V4-Flash-Vision-Exp a été lancé sur Hugging Face sous licence MIT : le premier modèle de la famille V4 qui gère les images, avec de grands progrès dans les tests d'agents multimodaux et des performances de texte qui restent stables.
DeepSeek a publié un nouveau modèle sur Hugging Face sans trop de bruit autour. DeepSeek-V4-Flash-Vision-Exp est le premier modèle de la famille V4 capable de regarder des images ainsi que de lire du texte, il pèse 305 milliards de paramètres et il est livré sous une licence MIT, qui est à peu près aussi permissive que les licences logicielles. L’entreprise le décrit comme expérimental et le nom porte le « Exp » pour le prouver.
L’approche est simple : prenez l’architecture V4-Flash existante, ajoutez des modules de vision et continuez à vous former. Il en ressort un modèle qui s’est considérablement amélioré dans le travail des agents multimodaux, tandis que les performances en texte uniquement sont restées à peu près là où elles étaient. Sur ApexBench, un test d’agent multimodal, il obtient un score de 36,5 contre 26,2 pour le précédent V4-Flash-0731, bien que cette comparaison soit généreuse, puisque l’ancien modèle ignore simplement les images en entrée. Lors de l’Agents’ Last Exam, il affiche 27,3, dépassant les 25,7 répertoriés par le propre tableau de DeepSeek pour l’Opus 4.8. Les chiffres côté texte sont presque inchangés : 83,9 sur Terminal Bench 2.1, 59,3 sur DeepSWE. Le référentiel fournit un tokenizer, une implémentation de référence et des recettes de service pour vLLM et SGLang, et des versions communautaires quantifiées sont apparues presque immédiatement.
Deux termes méritent d’être déballés. Les paramètres sont les nombres réglables à l’intérieur d’un modèle, les éléments réglés par l’entraînement. 305 milliards d’entre eux, c’est gros, et cela signifie que ce n’est pas quelque chose que vous exécutez sur un ordinateur portable. Les poids ouverts signifient que DeepSeek a publié ces chiffres pour que tout le monde puisse les télécharger, ce qui est différent des logiciels open source : vous obtenez le modèle fini, pas la recette ou les données d’entraînement. La licence MIT est la partie remarquable, car elle n’impose pratiquement aucune restriction à l’utilisation commerciale. Une entreprise européenne peut le télécharger, l’exécuter entièrement sur son propre matériel et ne jamais envoyer un seul document client au serveur de quelqu’un d’autre. Il s’agit d’une véritable option qui n’existait pas il y a quelques années, et c’est pourquoi les libérations de poids à ciel ouvert par les laboratoires chinois continuent d’être importantes pour des entreprises qui n’ont rien à voir avec la Chine.
Ce que cela signifie pour vous. Si vous utilisez l’IA via une fenêtre de discussion, rien ici n’est pour vous aujourd’hui, et ce n’est pas un problème. Si vous construisez des choses, cela vaut le détour : un modèle sous licence permissive qui lit des graphiques, des captures d’écran et des documents, à une taille que vous pouvez réellement héberger vous-même si vous disposez du matériel, est une chose utile à avoir. Cela vaut cependant la peine de garder les attentes fondées. « Expérimental » dans le nom d’un modèle signifie généralement des aspérités, les comparaisons de référence proviennent de DeepSeek plutôt que d’un évaluateur indépendant, et la lecture honnête des chiffres est que cela correspond aux meilleurs modèles propriétaires sur certaines tâches d’agent multimodal et les suit sur d’autres. C’est la direction qui est intéressante, pas la position dans le classement.
Sources
- Carte modèle DeepSeek-V4-Flash-Vision-Exp (Hugging Face)
- Collection DeepSeek-V4 (Hugging Face)
Sources: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
L'UE vient de classer ChatGPT comme moteur de recherche, et cela change ce qu'elle vous doit
La Commission européenne a désigné ChatGPT comme très grand moteur de recherche en ligne en vertu de la loi sur les services numériques, aux côtés de Reddit et Roblox comme plateformes. Tous trois ont autorisé 45 millions d’utilisateurs mensuels dans l’UE et ont jusqu’en janvier 2027 pour se conformer.