Das chinesische KI-Startup DeepSeek hat ein experimentelles multimodales Modell vorgestellt, das den US-Konkurrenten Anthropic Konkurrenz machen soll. Es erweitert seine Fähigkeiten über Text hinaus und umfasst visuelle Eingaben wie Bilder und Screenshots.
Das neue Modell, benannt DeepSeek-V4-Flash-Vision-Exp, basiert auf dem Flaggschiffmodell V4 Flash, das in diesem Jahr eingeführt wurde. Es weist Parität zu V4 Flash bei textbasierten Aufgaben auf, einschließlich der Logik und der Wissensaufnahme über die Welt, und enthält gleichzeitig multimodale Agentien, die es ermöglichen, visuelle Hinweise zu verarbeiten und darauf zu reagieren, ohne ständig menschlicher Überwachung.
Bei multimodalen Agenten-Benchmarks schliessen DeepSeek-V4-Flash-Vision-Exp den Leistungsabstand zu Opus-4.8 von Anthropic, einem führenden fortschrittlichen Modell in diesem Segment, an. Die chinesische Firma behauptet, dass das neue Modell im Vergleich zu seinem Vorgänger einen signifikanten Sprung in den multimodalen Fähigkeiten darstellt.
Das Modell ist nun über die DeepSeek API-Plattform zugänglich, wobei Bilder für Rechnungszwecke bis zu 384 Tokens pro Bild zu V4 Flash-Preisen tokenisiert werden. Zu den Eingabeoptionen gehören base64-verschlüsselte Bilder, externe URLs oder die Files API, wodurch Entwicklern eine flexible Integration ermöglicht.
Die Ankündigung erfolgte am Freitag, 21. August 2026, im Rahmen der laufenden Bemühungen von DeepSeek, sein Angebot von KI zu erweitern angesichts der zunehmenden Konkurrenz auf dem globalen KI-Markt.












