DeepSeek Vision API: el modelo de visión de $0.22/M-token que usa 10x menos KV cache
DeepSeek añadió ojos silenciosamente a su línea de modelos más barata. deepseek-v4-flash-vision-exp — la versión multimodal experimental de V4-Flash — acepta imágenes, capturas de pantalla, gráficos y frames de vídeo a precios de V4-Flash: $0.22 por millón de tokens de entrada, con cada imagen limitada a 384 tokens sin importar lo grande que sea.
La arquitectura lo hace aún más interesante: un vision transformer personalizado que exprime una imagen de 756×756 en solo 81 entradas de KV cache — aproximadamente 10x menos que Claude Sonnet 4.6 (~870) o Gemini Flash 3 (~1.000). A escala, eso es una diferencia de coste de infraestructura de 10x antes de mirar siquiera la lista de precios.
Esta guía cubre la API de punta a punta: las tres formas de enviar imágenes, precios y límites, el truco de los visual primitives, y una comparación honesta contra la competencia.
El modelo
| deepseek-v4-flash-vision-exp | |
|---|---|
| Base | DeepSeek-V4-Flash (284B total / 13B activos, MoE) |
| Contexto / Salida | 1M tokens / 384K máx |
| Precio de entrada | $0.22/M (off-peak, cache miss) · $0.007/M cache hit |
| Precio de salida | $0.66/M (off-peak) |
| Horas peak | 01:00-04:00 y 06:00-10:00 UTC (2x off-peak) |
| Concurrencia | 2.500 |
| Formatos | JPEG, PNG, GIF, WebP (por contenido, no por nombre) |
| También disponible vía | endpoint compatible con Anthropic /anthropic |
Tres formas de enviar imágenes
Todas usan el formato estándar Chat Completions de OpenAI — content es un array de bloques:
1. Base64 inline — la más simple para archivos locales:
import base64
from openai import OpenAI
client = OpenAI(api_key="<key>", base_url="https://api.deepseek.com")
b64 = base64.b64encode(open("image.jpg", "rb").read()).decode("utf-8")
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{"role": "user", "content": [
{"type": "text", "text": "¿Qué hay en esta imagen?"},
{"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{b64}"}},
]}],
)
print(response.choices[0].message.content)
2. URL externa — pasa un enlace público (máx. 8192 caracteres, 32 MiB, descarga en 60s):
{"type": "image_url", "image_url": {"url": "https://example.com/image.jpg"}}
3. Files API — sube una vez, reutiliza por file_id (hasta 64 MiB, mejor para uso repetido):
{"type": "file", "file_id": "file-api-xxxxxxxxxxxxxxxx"}
Campo detail opcional: low (reducida a 512×512, más barata/rápida), high/original/auto (mantiene el original).
El truco de precios: 384 tokens, pase lo que pase
Cada imagen se redimensiona automáticamente a aproximadamente 800×800 equivalente antes de la inferencia (las pequeñas se amplían, las grandes se reducen, preservando la proporción). El resultado:
Una imagen de 2000×2000 y una de 5000×5000 cuestan exactamente lo mismo: 384 tokens.
A $0.22/M de entrada, eso son $0.00008 por imagen (off-peak) antes del texto. A ~90 tokens por imagen típica, una petición de visión completa suele costar fracciones de centavo.
Por qué es 10x más eficiente: el pipeline de compresión
El DeepSeek Vision Transformer personalizado comprime las imágenes antes de que lleguen al KV cache:
| Etapa | Imagen de 756×756 |
|---|---|
| Patchificación (14×14) | 2.916 tokens de parche |
| Compresión espacial 3×3 | 324 tokens |
| Atención dispersa comprimida | 81 entradas KV |
Eso es una proporción de compresión pixel-a-cache de ~7.000x. La comparación práctica:
| Modelo | Entradas KV (imagen 80×80) |
|---|---|
| DeepSeek Vision | ~90 |
| Claude Sonnet 4.6 | ~870 |
| Gemini Flash 3 | ~1.000 |
Para pipelines de documentos, inspección visual o monitorización de vídeo a escala, eso es una diferencia de coste de infraestructura de 10x — antes de los precios por token.
Visual primitives: el modelo señala cosas
El arma secreta de DeepSeek: el modelo puede emitir tokens de coordenadas inline en su chain of thought:
<ref>perro</ref><box>x1,y1,x2,y2</box>
No es function calling. No es una herramienta separada. El modelo literalmente señala objetos mientras razona — como un humano trazando con el dedo. Aquí es donde supera a los grandes:
| Tarea (navegación de laberinto) | Puntuación |
|---|---|
| DeepSeek Vision | 67% |
| GPT-5.4 | 50% |
| Gemini Flash 3 | 49% |
| Claude Sonnet 4.6 | 49% |
Límites honestos (del propio paper de DeepSeek): limitado por resolución en detalles finos, los primitives deben activarse explícitamente (sin autodetección), el razonamiento por puntos no generaliza universalmente aún, y Gemini Flash 3 sigue liderando count QA.
Economía real
- $3 — un día completo de flujos de coding de un desarrollador en V4 pay-as-you-go
- $0.17 — un agente autónomo construyendo un paquete CLI completo de Python: 136 peticiones API, 12.6M tokens, suite de 142 tests
- 10-100x más barato — flujos de visión empresariales (extracción de facturas, captura-a-datos, control de calidad de fabricación) vs equivalentes de Claude/GPT-4o
Advertencias
- Las imágenes solo van en mensajes de usuario — las de system/assistant devuelven 400
- Solo los modelos de visión aceptan imágenes — otros modelos devuelven 400
- Residencia de datos — la API alojada corre desde China; las empresas con cumplimiento estricto pueden self-hostear los pesos abiertos (la válvula de escape que convierte un bloqueo de procurement en una decisión de infraestructura)
Conclusión
DeepSeek Vision no es solo barata — es arquitectónicamente barata. El backbone MoE, la compresión visual de 7.000x, el tope de 384 tokens y los visual primitives apuntan todos en la misma dirección: la representación más barata que sigue funcionando.
Para flujos de visión sensibles al coste y a la escala — facturas, capturas de pantalla, control de calidad, pipelines de documentos — es actualmente la opción más disruptiva del mercado. Para QA visual de grano fino, Gemini sigue teniendo la corona. Elige en consecuencia. 👁️
無程式碼也能輕鬆打造專業LINE官方帳號!一鍵導入模板,讓AI助你行銷加分!