La API V4 Flash Vision de DeepSeek es útil, pero sigue siendo experimental
DeepSeek ha añadido entradas de imagen a su línea de API rápida, pero la vista previa aún no demuestra un rendimiento fiable en capturas de pantalla, gráficos y documentos.
DeepSeek ha añadido entradas de imagen a su API mediante el modelo experimental deepseek-v4-flash-vision-exp. Acepta capturas de pantalla, gráficos y documentos a través de las conocidas interfaces JSON, Responses y compatible con Anthropic. Eso facilita las llamadas, pero no lo deja listo para sustituir una ruta de visión en producción.
El primer paso correcto es un piloto que empiece por los fallos: fija un conjunto pequeño de imágenes benignas y evaluadores específicos de la tarea, envía solicitudes acotadas, registra el uso real de tokens y el estado de la API, y conserva el flujo de trabajo existente como alternativa hasta que el modelo experimental supere controles explícitos de calidad, fiabilidad, latencia y coste.
No se realizaron llamadas a ningún endpoint para este artículo, por lo que no informa de nuevos resultados de tasa de éxito, latencia o coste. El protocolo siguiente está diseñado para producir esas mediciones sin confundir las afirmaciones del proveedor ni una demostración exitosa con evidencia de producción.
Qué publicó DeepSeek y qué sigue sin demostrarse
La actualización de la API del 21 de agosto de DeepSeek llama experimental al modelo DeepSeek-V4-Flash-Vision-Exp y dice que su rendimiento solo con texto está a la par del V4 Flash normal. La empresa también afirma que su capacidad de agente visual se acerca a Claude Opus 4.8. Son comparaciones del proveedor, no resultados reproducidos de forma independiente para este artículo.
SiliconANGLE informó de que el modelo está disponible a través de la plataforma de desarrolladores de pago de DeepSeek y señaló que la empresa no había revelado detalles de su arquitectura. Por tanto, la evidencia disponible establece una API experimental activa y su comportamiento documentado, no la precisión o fiabilidad con la que gestiona una carga de trabajo de producción concreta.
La página de precios actual indica una ventana de contexto de un millón de tokens y una salida máxima de 384.000 tokens. El modelo admite salidas JSON y llamadas a herramientas en las API JSON, Responses y compatible con Anthropic. Los límites amplios son techos de capacidad, no valores predeterminados sensatos para un piloto. Empieza con el límite de salida y el conjunto de imágenes más pequeños que necesite la tarea.
La elección del transporte cambia la evidencia
La guía de visión documenta tres formas de enviar una imagen. Difieren en el tamaño de la solicitud, los modos de fallo y la conveniencia de reutilizarlas.
| Transporte | Límite documentado | Úsalo cuando | Fallo que debe incluir el piloto |
|---|---|---|---|
| URL de datos Base64 | 32 MiB por imagen; el cuerpo completo de la solicitud está limitado a 48 MiB | La imagen es pequeña y debe viajar dentro de una sola solicitud | Codificación no válida, declaración de medio incorrecta y cuerpo por encima del límite |
| URL pública de imagen | URL de hasta 8.192 caracteres; imagen de 32 MiB; la descarga debe terminar en 60 segundos | La fuente es pública, estable y segura para que DeepSeek la descargue | Enlace caducado, bucle de redirección, origen lento y respuesta que no es una imagen |
Files API file_id | Imagen de hasta 64 MiB; la solicitud total puede alcanzar 200 MiB al incluir IDs de archivo | Se reutilizará el mismo artefacto aprobado o es demasiado grande para insertarlo en línea | Referencia ausente, caducada, no autorizada o al archivo equivocado |
Se admiten JPEG, PNG, GIF y WebP, y el servicio inspecciona el contenido real en lugar de confiar en el nombre del archivo. Las imágenes deben estar en los mensajes del usuario; colocarlas en mensajes del sistema o del asistente produce una respuesta 400. Una solicitud puede contener hasta 600 imágenes, pero el límite de dimensión por lado baja de 8.192 píxeles a 4.096 cuando contiene 15 o más. El piloto debe probar la cantidad prevista para producción, no la máxima anunciada.
En el endpoint compatible con Anthropic, las referencias de archivos requieren la cabecera documentada anthropic-beta: files-api-2025-04-14. En la API Responses, los mismos transportes de base64, URL y archivo están disponibles mediante input_image. Conserva la interfaz y el transporte en cada registro de ejecución; forman parte del sistema probado.
El detalle de la imagen cambia la evidencia y el coste
El ajuste detail no es cosmético. low reduce una imagen a 512 por 512 píxeles, lo que puede abaratar una escena amplia o un diseño, pero borrar etiquetas pequeñas. original conserva la imagen de origen; high es actualmente un alias de compatibilidad para ella. auto se comporta actualmente como original, así que depender de auto hace más difícil detectar un cambio futuro del servicio.
DeepSeek afirma que aumenta automáticamente el tamaño de las imágenes pequeñas y ajusta las más grandes hacia unos 800 por 800 píxeles totales, conservando la proporción. El límite superior documentado es de 384 tokens por imagen, pero el recuento real puede variar. Usa el usage devuelto con cada respuesta como registro de facturación, en lugar de estimarlo a partir del tamaño del archivo o las dimensiones en píxeles.
El precio de lista actual por millón de tokens es:
| Clase de token | Fuera de hora punta | Hora punta |
|---|---|---|
| Entrada en caché | $0.007 | $0.014 |
| Entrada sin caché | $0.22 | $0.44 |
| Salida | $0.66 | $1.32 |
Las horas punta actuales son 01:00–04:00 y 06:00–10:00 UTC. Los precios pueden cambiar, así que guarda el calendario de precios y la marca temporal de la evidencia junto a la ejecución. Para cada intento, calcula:
attempt cost = cached input × cache rate + uncached input × input rate + output × output rate
Divide los recuentos de tokens entre un millón al aplicar esas tarifas. Después divide el coste de todos los primeros intentos y reintentos entre las tareas aceptadas. Una respuesta barata que no completa la tarea no es una tarea completada barata.
La vista previa demuestra el acceso, no la preparación del producto
DeepSeek ha expuesto una superficie experimental útil: los desarrolladores pueden enviar imágenes mediante una API conocida y observar un modelo que combina visión con razonamiento textual. El anuncio y la documentación no establecen la precisión en capturas de pantalla, gráficos, documentos ni los casos de fallo importantes para un producto concreto.
La elección del transporte y el ajuste de detalle de la imagen también cambian lo que recibe el modelo y el coste de la solicitud. Por tanto, una demostración exitosa puede reflejar una imagen sencilla, un preprocesamiento generoso o una salida limitada, en lugar de un sistema visual generalmente fiable.
La evidencia independiente más importante que falta es una evaluación a nivel de tarea a través de las revisiones de la vista previa. Hasta que exista, es mejor entender DeepSeek V4 Flash Vision Exp como una dirección de avance: la capacidad multimodal está entrando en una línea de API rápida, pero la etiqueta experimental aún describe el contrato de fiabilidad.