EvoMap
API DeepSeek V4: Tokens baratos, costos ocultos

API DeepSeek V4: Tokens baratos, costos ocultos

8 de mayo de 2026
420 visualizaciones
deepseek deepseek-v4 llm-pricing ai-agent coding-agent prompt-caching token-economics

Soy Lena. He pasado las últimas dos semanas observando qué pasa cuando apuntas el flujo de trabajo de un agente a DeepSeek V4. No es un benchmark rápido. Solo... gestionando cosas, vigilando los contadores de tokens y rastreando a dónde va realmente el dinero.

Los precios parecían casi demasiado buenos. Y parte de eso lo es. Pero parte no es lo que parece — no porque los números sean incorrectos, sino porque solo cuentan parte de la historia. Esto es lo que he notado.

Lo que parece ofrecer la API DeepSeek v4

DeepSeek lanzó la versión 4 como vista previa el 24 de abril de 2026. Dos modelos, ambos con arquitectura MoE, ambos con una ventana de contexto 1M-token y hasta 384K de salida máxima.

V4 Pro: 1,6 billones de parámetros totales, 49 mil millones activados por token. El ID del modelo es deepseek-v4-pro. Está posicionado para razonamientos complejos, codificación y tareas agentes. Ahora mismo hay un descuento promocional del 75% hasta el 31 de mayo de 2026 — durante la promoción, estarás viendo **\0,435 pormilloˊndetokensdeentradafallidos∗∗y0,87por millón de tokens de entrada fallidos** y 0,87 por millón de tokens de salida. Después de la promoción, esos saltos a 1,74y3,481,74 y 3,48 respectivamente.

V4 Flash: 284 mil millones en total, 13 mil millones activados. El ID del modelo es deepseek-v4-flash. Diseñado para velocidad y eficiencia en costes. Precio de $0,14/M de entrada y $0,28/M de salida — no hace falta promoción, esa es la tarifa estándar.

Ambos soportan modos de pensamiento y no pensamiento, llamadas a herramientas, salida JSON y formato API compatible con OpenAI. Los alias antiguos de deepseek-chat y deepseek-reasoner están programados para la desactivación el 24 de julio de 2026.

! [imagen] (https://cdn.10b.ai/1778120214543-1.png)

Lo que debe verificarse antes de su uso en producción

He revisado la página oficial de precios varias veces. Algo que es fácil pasar por alto: el precio de entrada por impacto en caché bajó a 1/10 del precio de lanzamiento el 26 de abril de 2026. En V4 Flash, la entrada en caché es \0,0028/M — eso supone un descuento del 98% frente a la pérdida de caché. En la V4 Pro durante la promoción, la entrada en caché es \0,003625/M.

… Es un número bastante grande para pasar por alto.

Pero esto es lo que siempre volvía: los resultados en caché no están garantizados. La propia documentación de DeepSeek describe el almacenamiento en caché como el mejor esfuerzo. Puedes estructurar tus prompts para maximizar los resultados — prompt estable del sistema primero, contenido variable al final — pero no puedes asumir una tasa de acierto. Tienes que medirla.

Los números de benchmark también son sólidos. V4 Pro obtiene un 80,6% en SWE-bench Verified, que está a 0,2 puntos de los mejores modelos de código cerrado. V4 Flash solo queda unos 1,6 puntos por detrás en SWE-bench mientras cuesta aproximadamente 12 veces menos por token. Según el blog técnico de NVIDIA sobre V4, la arquitectura de atención híbrida (CSA + HCA) reduce los FLOP de inferencia al 27% y la caché KV al 10% de lo que V3.2 requería en contexto de 1M. Esos son beneficios arquitectónicos reales, no números de marketing.

Pero aún no estoy seguro de que los benchmarks digan mucho sobre lo que ocurre cuando un agente ejecuta la misma llamada a la herramienta seis veces porque las primeras cinco producían JSON malformado.

Por qué los tokens más baratos importan para los agentes

Las matemáticas son bastante sencillas. Cuando los tokens de entrada cuestan 0,14 dólares por millón, puedes permitirte hacer más experimentos. Más iteraciones. Más soluciones candidatas. Más evaluaciones aprobadas.

Para los flujos de trabajo de los agentes específicamente, esto cambia tres cosas:

Más ejecuciones por dólar. Un agente codificador que realiza 1.000 llamadas API con un prompt de sistema de 2.000 tokens, un mensaje de usuario de 200 tokens y una respuesta de 300 tokens cuesta aproximadamente **\117,60 en total en Flash V4** — suponiendo que el prompt del sistema almacene en caché. Ese mismo volumen en un modelo de entrada/salida de \15/\75 costaría más de \20.000. La brecha no es sutil.

! [imagen] (https://cdn.10b.ai/1778120217138-2.png)

Menor coste de entrada para experimentación. Si estás construyendo una pipeline de agentes y necesitas probar si las definiciones de tus herramientas funcionan, si la estructura de tu prompt se mantiene en casos límite, si tu harness de evaluación detecta los fallos adecuados — tokens baratos significan que realmente puedes iterar en lugar de adivinar.

La economía de caché recompensa la buena ingeniería.** Los equipos que estructuran bien sus prompts — prefijos estables, ejemplos consistentes con pocas fotos, contenido variable al final — son recompensados de forma desproporcionada. Como señaló el equipo de Hugging Face en su análisis V4, la combinación de atención híbrida y precios agresivos de caché hace que los bucles de agentes de contexto largo sean realmente prácticos a gran escala.

No dejaba de pensar en esto: la ventaja de coste no es solo pagar menos. Se trata de poder permitirse la depuración.

El cuesto oculto no elimina la inferencia barata

Esta es la parte con la que me senté un tiempo.

Los tokens baratos reducen una línea en el billete. Pero los costes de los agentes no están dominados por el precio del token. Están dominados por lo que ocurre cuando las cosas van mal — y las cosas salen mal con frecuencia.

Llamadas fallidas a herramientas

La propia documentación de DeepSeek advierte explícitamente: el modelo puede generar JSON inválido y puede inventar parámetros que no están definidos en tu esquema de función. Debes validar los argumentos antes de ejecutar cualquier función. Este no es un problema específico de DeepSeek: todos los modelos lo hacen. Pero a escala de agentes, una tasa de fallos del 5% en las llamadas a herramientas no significa que el 5% de tus costos se desperdicien. Significa que el 5% de tus llamadas provocan reintentos, manejo de errores, re-preguntas y, potencialmente, fallos en cascada aguas abajo.

…ese costo no aparece en la página de precios.

Reintentos y depuración repetida

Un agente que reintenta un paso fallido tres veces consume 4 veces los tokens de uno que tiene éxito en el primer intento. Los tokens de entrada baratos ayudan, pero no resuelven el problema subyacente: que ​el modelo no hizo lo que le pediste​. Si tu lógica de reintento solo reenvía el mismo prompt, estás pagando por el mismo error repetidamente.

Noté este patrón al observar a V4 Flash manejar tareas de varios pasos. Es rápido, es barato y en pasos sencillos es realmente bueno. Pero en pasos que requieren una salida estructurada precisa o una orquestación compleja de herramientas, la tasa de fallos fue notablemente mayor que la de V4 Pro. La diferencia de costo de 12 veces entre Flash y Pro empieza a comprimirse cuando consideras los reintentos.

Sobrecarga de evaluación

Aquí hay algo para lo que casi nadie hace presupuesto: ​todavía necesitas evaluar si la salida del agente es correcta​. Si usas una segunda llamada al modelo para verificar la primera, tu costo efectivo se duplica. Si utilizas un modelo más caro como juez, la ventaja de precio por token se evapora parcialmente.

El anuncio de lanzamiento de V4 presenta a Flash como igual de competente que Pro en "tareas simples de agentes". Ese calificativo importa. Para programación agente compleja — SWE-bench Pro, que prueba escenarios multi-paso más difíciles — V4 Pro obtuvo un 55,4% frente a los líderes de código cerrado con 64,3%. Esa brecha significa más intentos fallidos, más revisión humana, más ciclos de evaluación.

Latencia y fiabilidad

La API de DeepSeek se aloja principalmente en China. Durante las horas pico, los picos de latencia son reales. Para flujos de trabajo de agentes síncronos donde cada paso depende del anterior, un pico de latencia de 5 segundos en cada tercera llamada se acumula rápidamente — no en costo de tokens, sino en tiempo real que tu equipo está esperando.

No estoy seguro de cómo cuantificar esto todavía. Pero no se sintió despreciable.

El punto ciego de los tokens de razonamiento

Una cosa más. V4 soporta el modo de pensamiento, donde el modelo genera tokens de razonamiento internos antes de producir una respuesta visible. Estos tokens de razonamiento cuentan para tu factura. En una tarea compleja de agente de varios pasos con modo de pensamiento activado, el modelo podría generar entre 2.000 y 3.000 tokens de razonamiento antes de producir una respuesta de 200 tokens. Tu coste efectivo por token de salida visible podría ser 10 veces mayor de lo que sugiere la tasa de salida.

No lo valoré del todo hasta que empecé a seguir el campo de completion_tokens_details en las respuestas. La diferencia entre lo que ves y lo que pagas puede ser significativa.

! [imagen] (https://cdn.10b.ai/1778120220285-4.png)

Cuando la API DeepSeek v4 es una opción muy adecuada

Después de observar esto un rato, el patrón se vuelve más claro:

Cargas de trabajo de alto volumen y compatibles con caché. Si tu agente reutiliza un prompt estable del sistema entre miles de llamadas, caché contextual puede elevar los costes efectivos de entrada por debajo de \0,01/M en la versión flash V4. Análisis de repositorios, revisión por lotes de código, procesamiento de documentos — son encajes naturales.

Experimentación y prototipado. Cuando aún estás averiguando si una arquitectura de agente funciona, la diferencia entre los tokens de entrada $0.14/M y $5/M es la diferencia entre "déjame probar esto" y "déjame pensar si merece la pena probar".

Pipelines no críticos con presupuestos de reintentos. Si tu flujo de trabajo tolera fallos ocasionales y tienes lógica de reintentos incorporada, V4 Flash te da espacio para absorber esos intentos sin gastar tu presupuesto.

Agentes de codificación en tareas bien definidas. La puntuación Codeforce de V4 Pro de 3.206 y la puntuación de LiveCodeBench del 93,5% son las más altas entre los modelos de peso abierto. Para problemas de programación competitiva y tareas de codificación contenidas, la relación calidad-coste es difícil de superar.

Cuando la inferencia barata puede engañar a los equipos

… esta es la parte a la que vuelvo una y otra vez.

Cuando confundes un precio bajo de token con un bajo coste total. Si el flujo de trabajo de tu agente tiene una tasa de fallo del 15% y cada fallo provoca dos intentos más una revisión humana, tu coste efectivo por completo exitoso podría ser de 3 a 5 veces el precio bruto del token. La página de precios no puede decirte esto. Solo tus registros pueden.

**Cuando te saltas la evaluación porque "es lo suficientemente barato como para ejecutarlo." ** La inferencia barata puede crear una falsa sensación de seguridad. He visto este patrón: los tokens son tan baratos que los equipos dejan de medir si los resultados son realmente correctos. El coste no está en la ley de API — está en las malas decisiones tomadas aguas abajo.

Cuando el precio promocional se convierte en tu suposición base. El descuento del 75% de V4 Pro dura hasta el 31 de mayo de 2026. Después de eso, el precio de salida salta de $0,87/M a $3,48/M. Si estás construyendo infraestructura de producción alrededor de la tarifa con descuento, necesitas un plan para lo que ocurre cuando termine.

Cuando la latencia importa más que el coste. Los flujos de trabajo de agentes que requieren respuestas en menos de segundos para casos de uso interactivos pueden encontrar la latencia variable de DeepSeek — especialmente fuera de Asia — más difícil de manejar de lo que sugieren los precios. Proveedores externos como Fireworks y DeepInfra ofrecen V4 a través de su propia infraestructura con perfiles de latencia potencialmente mejores, pero añaden un margen que reduce la brecha de costes.

Puede que esté dándole demasiadas vueltas a algunas de estas cosas. Pero prefiero señalarlo ahora que darme cuenta más adelante.

! [imagen] (https://cdn.10b.ai/1778120222958-5.png)

Preguntas frecuentes

¿Qué ID de modelo debería usar — deepseek-chat** o deepseek-v4-flash****?**

Usa deepseek-v4-flash o deepseek-v4-pro directamente. Los antiguos alias (deepseek-chat, deepseek-reasoner) se dirigen a la versión V4 Flash por ahora, pero están programados para su eliminación el 24 de julio de 2026.

¿Es permanente el 75% de descuento en V4 Pro?

No. La página oficial de precios indica que se extiende hasta el 31 de mayo de 2026 a las 15:59 UTC. Después de eso, se aplican los precios de lista a menos que DeepSeek anuncie otra prórroga.

¿Cómo puedo maximizar las tasas de acierto en caché?

Pon tu contenido estable — prompt del sistema, definiciones de herramientas, ejemplos de pocas fotos — al principio del array de mensajes. El contenido variable va al final. Monitoriza prompt_cache_hit_tokens en cada respuesta de la API para medir las tasas reales de acierto en lugar de asumir.

¿Debería empezar con V4 Flash o V4 Pro para trabajo de agente?

Empieza con Flash. Cuesta 12 veces menos y rinde dentro de unos pocos puntos porcentuales de Pro en la mayoría de los benchmarks. Escala a Pro solo cuando tu propia evaluación muestre que la calidad de Flash no es suficiente para un tipo de tarea específico.

¿Puedo auto-presentar V4?

Ambos modelos se lanzan bajo la licencia MIT con pesos disponibles en Hugging Face. El Flash V4 a 284B parámetros es factible en una configuración multiGPU. V4 Pro con parámetros de 1,6T requiere una capacidad significativa de clúster — la mayoría de los equipos usarán la API para Pro.

Publicaciones anteriores:

Artículos relacionados