La empresa china de IA DeepSeek ha presentado un modelo multimodal experimental diseñado para competir con su rival estadounidense Anthropic, ampliando sus capacidades más allá del texto para incluir entradas visuales, como imágenes y capturas de pantalla.
El nuevo modelo, llamado DeepSeek-V4-Flash-Vision-Exp, se basa en el modelo V4 Flash del buque insignia de la empresa, que se lanzó a principios de este año. Mantiene la paridad con V4 Flash en tareas basadas en texto, incluyendo razonamiento y conocimiento del mundo, al mismo tiempo que introduce funcionalidad de agentes multimodales que le permiten procesar y actuar según las peticiones visuales sin supervisión constante por parte de un ser humano.
En las pruebas de referencia multicompetente, DeepSeek-V4-Flash-Vision-Exp reduce la brecha de rendimiento con Opus-4.8 de Anthropic, un modelo avanzado líder en el segmento. La empresa china afirma que el nuevo modelo ofrece un salto significativo en las capacidades multicompuestas en comparación con su antecesor.
El modelo ahora está accesible mediante la plataforma de API de DeepSeek, con imágenes tokenizadas para fines de facturación de hasta 384 tokens cada una al precio de V4 Flash. Las opciones de entrada incluyen imágenes codificadas en base64, URL externas o la API de archivos, lo que permite una integración flexible para los desarrolladores.
El anuncio se hizo el viernes 21 de agosto de 2026, como parte de los continuos esfuerzos de DeepSeek por ampliar su oferta de IA en medio de una competencia cada vez mayor en el mercado mundial de inteligencia artificial.












