La carrera por la IA multimodal: qué significa que DeepSeek retese a Anthropic
DeepSeek acaba de lanzar DeepSeek-V4-Flash-Vision-Exp, un modelo que añade capacidad de visión a su versión anterior de solo texto. Esto significa que ahora puede procesar tanto imágenes como palabras en las mismas consultas, algo que amplía significativamente sus aplicaciones prácticas. El punto de partida es importante: no se trata solo de un modelo más rápido o barato, sino de uno que funciona en dos modalidades distintas.
En las pruebas de rendimiento, el modelo de DeepSeek supera a Opus 4.8 de Anthropic en tres de once evaluaciones: DeepSWE, Agents’ Last Exam y ZeroBench. Sin embargo, en ocho pruebas restantes queda por debajo, con una brecha que llega hasta doce puntos en NL2Repo, que mide la capacidad de resolver tareas complejas en repositorios de código. Dicho de otro modo: DeepSeek gana en algunos ámbitos muy específicos, pero Anthropic mantiene ventaja en la mayoría.
Lo que realmente diferencia a este modelo es el coste. Procesar un millón de palabras con DeepSeek-V4-Flash-Vision-Exp ronda los 0,87 dólares, mientras que con Opus 4.8 de Anthropic llega a los 50 dólares por la misma cantidad. Esa es una brecha de escala que no puedes ignorar si tu actividad depende de procesar volúmenes grandes de información.
Ventajas técnicas que debes conocer
- Las imágenes se cobran al mismo precio que texto estándar, no hay tarifa diferenciada
- La API permite subir una imagen una sola vez y reutilizarla en consultas posteriores sin recargarla
- El modelo mantiene las capacidades de texto de la versión anterior, incluidas tareas de razonamiento y manejo de agentes
- Ya está integrado en la plataforma de API de DeepSeek y compatible con su entorno para agentes en versión 0.1.1
Un error frecuente al evaluar modelos de IA es mirar solo el rendimiento en benchmarks generales y olvidar el contexto real de uso. Si necesitas procesar miles de documentos con imágenes integradas, ese coste por millón de palabras marca diferencias enormes a fin de año. Pero si tu tarea requiere rendimiento máximo en repositorios de código o análisis complejos de datos, puede que la diferencia de doce puntos en una prueba te incline hacia otra solución.
Lo que ves aquí es una tendencia clara: la competencia en IA multimodal se intensifica, y cada proveedor apuesta por nichos distintos. DeepSeek busca la eficiencia y el precio. Anthropic mantiene una posición en rendimiento bruto. Ninguno es definitivamente mejor; depende enteramente de qué necesitas hacer, cuál es tu presupuesto y qué margen de error puedes tolerar en cada tarea específica.
