AI

DeepSeek Vision API: el modelo de visión de $0.22/M-token que usa 10x menos KV cache

deepseek-v4-flash-vision-exp trae visión a la línea V4-Flash: un modelo MoE de 284B parámetros (13B activos) que factura imágenes a solo $0.22 por millón de tokens de entrada, limita cada imagen a 384 tokens sin importar la resolución, y comprime imágenes en ~90 entradas de KV cache — 10x menos que Claude y Gemini. Guía completa: tres formas de enviar imágenes, precios, límites, el truco de los visual primitives, y comparación con GPT-4o, Claude y Gemini.

Keeping this site alive takes effort — your support means everything.
無程式碼也能輕鬆打造專業LINE官方帳號!一鍵導入模板,讓AI助你行銷加分! 無程式碼也能輕鬆打造專業LINE官方帳號!一鍵導入模板,讓AI助你行銷加分!
DeepSeek Vision API: el modelo de visión de $0.22/M-token que usa 10x menos KV cache

Conclusiones clave

  • deepseek-v4-flash-vision-exp es el modelo multimodal experimental de DeepSeek: 284B parámetros totales (13B activos, MoE), contexto de 1M tokens, salida máxima de 384K. Iguala a V4-Flash en texto y da un salto en benchmarks de agentes multimodales — acercándose a Anthropic Opus 4.8 — a precios de V4-Flash: $0.22/M de entrada (cache miss, off-peak), $0.007/M (cache hit), $0.66/M de salida.
  • Tres formas de enviar imágenes: base64 inline (data: URL, cuenta para el límite de 48 MiB del cuerpo), URL externa (máx. 8192 caracteres, 32 MiB, descarga en 60s), o file_id de la Files API (hasta 64 MiB, mejor para reutilizar). Formatos: JPEG, PNG, GIF, WebP — detectados por contenido, no por nombre de archivo. Las imágenes solo van en mensajes de usuario; otros modelos las rechazan con 400.
  • La facturación es brutalmente barata: cada imagen se redimensiona a ~800x800-equivalente y se limita a 384 tokens — una imagen de 2000x2000 y una de 5000x5000 cuestan lo mismo. El DeepSeek Vision Transformer comprime una imagen de 756x756 en solo 81 entradas de KV cache vía patchificación (2.916) → compresión espacial (324) → atención dispersa (81): ~7.000x de compresión pixel-a-cache, ~10x menos entradas KV que Claude Sonnet 4.6 (~870) y Gemini Flash 3 (~1.000).
  • Visual primitives: el modelo emite tokens de coordenadas inline como labelx1,y1,x2,y2 en su chain of thought — literalmente señala objetos mientras razona. En navegación de laberintos puntúa 67% vs GPT-5.4 (50%), Gemini Flash 3 (49%), Claude Sonnet 4.6 (49%). Límites honestos: limitado por resolución en detalles finos, Gemini aún lidera count QA, y los primitives deben activarse explícitamente.
  • Economía real: desarrolladores reportan $3/día de coding en V4, y un agente autónomo que costó $0.17 (136 peticiones, 12.6M tokens). Los flujos de visión empresariales (facturas, capturas de pantalla, control de calidad) cuestan 10-100x menos que los equivalentes con Claude/GPT-4o. Advertencias: la API alojada corre desde China (residencia de datos), así que las empresas pueden self-hostear los pesos abiertos.

Respuestas clave

¿Qué es el modelo de visión de DeepSeek?

deepseek-v4-flash-vision-exp es un modelo multimodal experimental en la API de DeepSeek (base_url https://api.deepseek.com). Está construido sobre la arquitectura DeepSeek-V4-Flash: 284B parámetros totales con 13B activos (Mixture of Experts), ventana de contexto de 1M, salida máxima de 384K. Acepta imágenes junto a texto — JPEG, PNG, GIF, WebP — e iguala a V4-Flash en capacidades de texto mientras da un salto en benchmarks de agentes multimodales, acercándose a Anthropic Opus 4.8. También está disponible vía el endpoint compatible con Anthropic (/anthropic).

¿Cómo envío una imagen a DeepSeek Vision?

Tres formas, todas compatibles con OpenAI: (1) base64 inline — codifica la imagen como data: URL en un bloque image_url (cuenta para el límite de 48 MiB del cuerpo); (2) URL externa — pasa un enlace https público (máx. 8192 caracteres, imagen máx. 32 MiB, descarga en 60s); (3) Files API — sube una vez con la Files API y referencia file_id (hasta 64 MiB, mejor para reutilizar o imágenes grandes). También puedes usar file_data para base64 inline en un bloque file. El endpoint de Anthropic usa bloques image con source.type base64/url/file.

¿Cuánto cuesta la visión de DeepSeek?

Igual que V4-Flash: $0.22 por 1M de tokens de entrada (cache miss, off-peak; $0.44 en peak), $0.007/$0.014 por 1M en cache hit, $0.66/$1.32 por 1M de salida. Las imágenes se facturan como tokens de entrada con un tope duro de 384 tokens por imagen — sin importar la resolución (una de 2000x2000 y una de 5000x5000 cuestan idéntico). Las horas off-peak son todas excepto 01:00-04:00 y 06:00-10:00 UTC. A ~90 tokens por imagen típica, una petición de visión completa suele costar fracciones de centavo.

¿Cuáles son los límites de imagen?

Solo JPEG/PNG/GIF/WebP (detectados por contenido). URLs externas máx. 8192 caracteres; cuerpo de petición máx. 48 MiB; imagen individual máx. 32 MiB (inline/URL) o 64 MiB (file_id de Files API); hasta 600 imágenes por petición; tamaño total máx. 64 MiB sin file_id o 200 MiB con; dimensión máx. 8192 px por lado (baja a 4096 px con 15+ imágenes). Las imágenes solo se aceptan en mensajes de usuario — las de system/assistant devuelven 400, y solo los modelos de visión las aceptan.

¿Qué son los 'visual primitives' en DeepSeek Vision?

Una técnica donde el modelo emite tokens de coordenadas especiales inline en su chain-of-thought, ej. labelx1,y1,x2,y2. Esto permite al modelo señalar literalmente objetos mientras razona — como un humano trazando objetos con el dedo — lo que mejora drásticamente tareas topológicas/espaciales. En navegación de laberintos DeepSeek puntúa 67% vs GPT-5.4 (50%), Gemini Flash 3 (49%), Claude Sonnet 4.6 (49%). Advertencias: los primitives deben activarse explícitamente, está limitado por resolución en detalles finos, y Gemini aún lidera count QA.

DeepSeek Vision API: el modelo de visión de $0.22/M-token que usa 10x menos KV cache

DeepSeek añadió ojos silenciosamente a su línea de modelos más barata. deepseek-v4-flash-vision-exp — la versión multimodal experimental de V4-Flash — acepta imágenes, capturas de pantalla, gráficos y frames de vídeo a precios de V4-Flash: $0.22 por millón de tokens de entrada, con cada imagen limitada a 384 tokens sin importar lo grande que sea.

La arquitectura lo hace aún más interesante: un vision transformer personalizado que exprime una imagen de 756×756 en solo 81 entradas de KV cache — aproximadamente 10x menos que Claude Sonnet 4.6 (~870) o Gemini Flash 3 (~1.000). A escala, eso es una diferencia de coste de infraestructura de 10x antes de mirar siquiera la lista de precios.

Esta guía cubre la API de punta a punta: las tres formas de enviar imágenes, precios y límites, el truco de los visual primitives, y una comparación honesta contra la competencia.

El modelo

deepseek-v4-flash-vision-exp
BaseDeepSeek-V4-Flash (284B total / 13B activos, MoE)
Contexto / Salida1M tokens / 384K máx
Precio de entrada$0.22/M (off-peak, cache miss) · $0.007/M cache hit
Precio de salida$0.66/M (off-peak)
Horas peak01:00-04:00 y 06:00-10:00 UTC (2x off-peak)
Concurrencia2.500
FormatosJPEG, PNG, GIF, WebP (por contenido, no por nombre)
También disponible víaendpoint compatible con Anthropic /anthropic

Tres formas de enviar imágenes

Todas usan el formato estándar Chat Completions de OpenAI — content es un array de bloques:

1. Base64 inline — la más simple para archivos locales:

import base64
from openai import OpenAI

client = OpenAI(api_key="<key>", base_url="https://api.deepseek.com")
b64 = base64.b64encode(open("image.jpg", "rb").read()).decode("utf-8")

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{"role": "user", "content": [
        {"type": "text", "text": "¿Qué hay en esta imagen?"},
        {"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{b64}"}},
    ]}],
)
print(response.choices[0].message.content)

2. URL externa — pasa un enlace público (máx. 8192 caracteres, 32 MiB, descarga en 60s):

{"type": "image_url", "image_url": {"url": "https://example.com/image.jpg"}}

3. Files API — sube una vez, reutiliza por file_id (hasta 64 MiB, mejor para uso repetido):

{"type": "file", "file_id": "file-api-xxxxxxxxxxxxxxxx"}

Campo detail opcional: low (reducida a 512×512, más barata/rápida), high/original/auto (mantiene el original).

El truco de precios: 384 tokens, pase lo que pase

Cada imagen se redimensiona automáticamente a aproximadamente 800×800 equivalente antes de la inferencia (las pequeñas se amplían, las grandes se reducen, preservando la proporción). El resultado:

Una imagen de 2000×2000 y una de 5000×5000 cuestan exactamente lo mismo: 384 tokens.

A $0.22/M de entrada, eso son $0.00008 por imagen (off-peak) antes del texto. A ~90 tokens por imagen típica, una petición de visión completa suele costar fracciones de centavo.

Por qué es 10x más eficiente: el pipeline de compresión

El DeepSeek Vision Transformer personalizado comprime las imágenes antes de que lleguen al KV cache:

EtapaImagen de 756×756
Patchificación (14×14)2.916 tokens de parche
Compresión espacial 3×3324 tokens
Atención dispersa comprimida81 entradas KV

Eso es una proporción de compresión pixel-a-cache de ~7.000x. La comparación práctica:

ModeloEntradas KV (imagen 80×80)
DeepSeek Vision~90
Claude Sonnet 4.6~870
Gemini Flash 3~1.000

Para pipelines de documentos, inspección visual o monitorización de vídeo a escala, eso es una diferencia de coste de infraestructura de 10x — antes de los precios por token.

Visual primitives: el modelo señala cosas

El arma secreta de DeepSeek: el modelo puede emitir tokens de coordenadas inline en su chain of thought:

<ref>perro</ref><box>x1,y1,x2,y2</box>

No es function calling. No es una herramienta separada. El modelo literalmente señala objetos mientras razona — como un humano trazando con el dedo. Aquí es donde supera a los grandes:

Tarea (navegación de laberinto)Puntuación
DeepSeek Vision67%
GPT-5.450%
Gemini Flash 349%
Claude Sonnet 4.649%

Límites honestos (del propio paper de DeepSeek): limitado por resolución en detalles finos, los primitives deben activarse explícitamente (sin autodetección), el razonamiento por puntos no generaliza universalmente aún, y Gemini Flash 3 sigue liderando count QA.

Economía real

  • $3 — un día completo de flujos de coding de un desarrollador en V4 pay-as-you-go
  • $0.17 — un agente autónomo construyendo un paquete CLI completo de Python: 136 peticiones API, 12.6M tokens, suite de 142 tests
  • 10-100x más barato — flujos de visión empresariales (extracción de facturas, captura-a-datos, control de calidad de fabricación) vs equivalentes de Claude/GPT-4o

Advertencias

  • Las imágenes solo van en mensajes de usuario — las de system/assistant devuelven 400
  • Solo los modelos de visión aceptan imágenes — otros modelos devuelven 400
  • Residencia de datos — la API alojada corre desde China; las empresas con cumplimiento estricto pueden self-hostear los pesos abiertos (la válvula de escape que convierte un bloqueo de procurement en una decisión de infraestructura)

Conclusión

DeepSeek Vision no es solo barata — es arquitectónicamente barata. El backbone MoE, la compresión visual de 7.000x, el tope de 384 tokens y los visual primitives apuntan todos en la misma dirección: la representación más barata que sigue funcionando.

Para flujos de visión sensibles al coste y a la escala — facturas, capturas de pantalla, control de calidad, pipelines de documentos — es actualmente la opción más disruptiva del mercado. Para QA visual de grano fino, Gemini sigue teniendo la corona. Elige en consecuencia. 👁️