La start-up chinoise d'intelligence artificielle DeepSeek a dévoilé un modèle multimodal expérimental conçu pour rivaliser avec son concurrent américain Anthropic, en augmentant ses capacités au-delà du texte pour inclure des données visuelles telles que des images et des captures d'écran.
Le nouveau modèle, baptisé DeepSeek-V4-Flash-Vision-Exp, s'inspire du modèle V4 Flash du même nom, phare de l'entreprise, lancé plus tôt cette année. Il est à parité avec V4 Flash dans les tâches basées sur le texte, notamment le raisonnement et la connaissance du monde, tout en introduisant une fonctionnalité d'agent multimodal qui lui permet de traiter et d'agir sur des instructions visuelles sans surveillance permanente de l'être humain.
Sur les benchmarks d'agent multimodal, DeepSeek-V4-Flash-Vision-Exp réduit le écart de performance avec Opus-4.8 d'Anthropic, un modèle avancé de premier plan dans le segment. La société chinoise affirme que le nouveau modèle représente un progrès notable en ce qui concerne les capacités multimodales par rapport à son prédécesseur.
Le modèle est désormais accessible via la plateforme d'API de DeepSeek, avec des images tokenisées à des fins de facturation, à un tarif de 384 tokens chacun au tarif Flash V4. Les options d'entrée comprennent des images codées en base64, des URL externes ou l'API Files, permettant une intégration flexible pour les développeurs.
Cette annonce a été annoncée le vendredi 21 août 2026, dans le cadre des efforts continus de DeepSeek visant à développer ses offres d’IA, au milieu d’une concurrence accrue sur le marché mondial de l’intelligence artificielle.













