Le modèle bon marché de DeepSeek peut désormais voir, et il dépasse l'Opus 4.8 sur deux tests visuels
V4-Flash-Vision-Exp ajoute la compréhension des images au modèle plus petit de DeepSeek. Les images sont facturées jusqu'à 384 jetons chacune, au même prix que le texte.
DeepSeek a publié le 21 août une version expérimentale de son modèle plus petit, capable de visualiser des images. V4-Flash-Vision-Exp est disponible sur la plate-forme API de l’entreprise, conserve les capacités de texte du V4-Flash existant et ajoute en plus la compréhension des images.
Les deux chiffres cités proviennent de repères visuels. Sur ALE, un ensemble de tâches d’application longues en plusieurs étapes, le modèle de DeepSeek a obtenu un score de 27,3 contre Opus 4.8 d’Anthropic à 25,7. Sur ZeroBench, une collection de 100 puzzles d’analyse d’images volontairement difficiles, il atteint 35,0 contre 34,0 pour l’Opus 4.8. Il s’agit dans les deux cas de victoires serrées sur deux tests, et non d’une revendication générale de supériorité, et DeepSeek lui-même le formule plus modestement : les performances de l’agent multimodal sont désormais “proches de l’Opus-4.8”. Le modèle de base en dessous est une conception mixte d’experts, ce qui signifie que le modèle complet contient un grand nombre de paramètres mais n’en active qu’une petite partie pour une demande donnée, ce qui explique pourquoi son exécution reste peu coûteuse.
Les détails pratiques comptent plus que le classement. Les images sont converties en jetons pour une facturation allant jusqu’à 384 jetons chacun, facturés au tarif V4-Flash ordinaire, donc l’ajout d’une capture d’écran à une demande coûte à peu près ce que coûteraient quelques paragraphes de texte. DeepSeek a également activé une API de fichiers le même jour : vous téléchargez une image une fois, récupérez un ID de fichier et référencez cet ID dans des requêtes ultérieures au lieu de retélécharger. C’est gratuit et cela permet d’économiser beaucoup de bande passante si vous envoyez le même document ou diagramme à plusieurs reprises.
Le mot « expérimental » dans le nom du modèle fait un véritable travail. DeepSeek a déjà utilisé le suffixe “-Exp” pour les modèles qui sont testés en public, ajustés, puis intégrés dans une version stable. Ne construisez pas encore quoi que ce soit dont vous dépendez autour de lui. À savoir également : il s’agit d’une version API uniquement. DeepSeek a déjà publié des pondérations ouvertes pour plusieurs de ses modèles, y compris le V4-Flash en juillet, mais rien n’a été publié jusqu’à présent pour la variante vision. Le schéma plus large est que la vision n’est plus une fonctionnalité premium réservée aux modèles les plus grands et les plus chers. Une fois qu’un modèle bon marché peut lire de manière fiable une capture d’écran, un graphique ou une facture numérisée, une grande partie de l’automatisation quotidienne devient abordable, ce qui ne l’était pas auparavant.
Ce que cela signifie pour vous : si vous êtes simplement curieux de connaître l’IA, ce qu’il faut retenir, c’est que « peut-il regarder ma capture d’écran » devient rapidement une fonctionnalité standard plutôt qu’un argument de vente. Si vous construisez avec ces outils, le chiffre intéressant est le prix, pas la référence : la saisie d’images au tarif du texte rend le traitement des documents, le débogage des captures d’écran et la lecture des graphiques suffisamment bon marché pour essayer un volume réel. Une mise en garde avant de vous enthousiasmer : les modèles expérimentaux peuvent changer ou disparaître, et les écarts de référence ici sont d’environ un point, ce qui se situe bien dans la fourchette dans laquelle un test différent inverserait le classement.
##Sources
- [Version DeepSeek-V4-Flash-Vision-Exp, documentation de l’API DeepSeek] (https://api-docs.deepseek.com/news/news260821/) -DeepSeek lance un modèle de langage multimodal compétitif avec Opus 4.8, SiliconANGLE -DeepSeek lance un modèle multimodal expérimental pour rivaliser avec Anthropic, The Next Web
Les modèles gratuits de Google ont dépassé le milliard de téléchargements. Certains d’entre eux fonctionnent en orbite
Gemma a franchi le milliard de téléchargements et 100 000 variantes communautaires en deux ans. Qwen, d'Alibaba, en réclamait trois milliards cinq jours plus tôt.