Eu sou a Lena. Passei as últimas duas semanas observando o que acontece quando você aponta o fluxo de trabalho de um agente para DeepSeek V4. Não é um benchmark rápido. Só... rodar coisas, observar contadores de tokens e acompanhar para onde o dinheiro realmente vai.
Os preços pareciam quase bons demais. E parte disso é. Mas parte não é o que parece — não porque os números estejam errados, mas porque os números só contam parte da história. Foi isso que percebi.
O que a API DeepSeek V4 Parece Oferecer
A DeepSeek lançou a V4 como prévia em 24 de abril de 2026. Dois modelos, ambos com arquitetura MoE, ambos com uma janela de contexto de 1M-token e até 384K de saída máxima.
V4 Pro: 1,6 trilhão de parâmetros totais, 49 bilhões ativados por token. O ID do modelo é deepseek-v4-pro. Ele está posicionado para raciocínio complexo, codificação e tarefas agentes. Atualmente, há um desconto promocional de 75% até 31 de maio de 2026 — durante a promoção, você está falando de $0,435 por milhão de tokens de entrada cache-miss e $0,87 por milhão de tokens de saída. Após a promoção, esses valores sobem para $1,74 e $3,48, respectivamente.
V4 Flash: 284 bilhões no total, 13 bilhões ativados. ID do modelo é deepseek-v4-flash. Construído para velocidade e eficiência de custos. Preço de $0,14/M entrada e $0,28/M de saída — não precisa de promoção, essa é a tarifa padrão.
Ambos suportam modos de pensamento e não-pensamento, chamadas de ferramenta, saída JSON e formato API compatível com OpenAI. Os antigos aliases deepseek-chat e deepseek-reasoner estão programados para descontinuação em 24 de julho de 2026.
! [imagem] (https://cdn.10b.ai/1778120214543-1.png)
O que deve ser verificado antes do uso em produção
Passei algumas vezes pela página oficial de preços. Uma coisa fácil de não perceber: o preço de entrada por impacto em cache caiu para 1/10 do preço de lançamento em 26 de abril de 2026. No V4 Flash, a entrada em cache é $0,0028/M — isso representa um desconto de 98% em relação ao cache-miss. No V4 Pro, durante a promoção, a entrada em cache é $0,003625/M.
… Esse é um número bem grande para se ignorar.
Mas aqui está o que eu sempre voltei: acessos em cache não são garantidos. A própria documentação do DeepSeek descreve o cache como o melhor esforço. Você pode estruturar seus prompts para maximizar os acertos — prompt do sistema estável primeiro, conteúdo variável no final — mas não pode assumir uma taxa de acerto. Você precisa medi-la.
Os números dos benchmarks também são fortes. O V4 Pro obtém 80,6% no SWE-bench Verified, que está a menos de 0,2 ponto dos melhores modelos de código fechado. O V4 Flash fica apenas cerca de 1,6 ponto atrás no SWE-bench, custando cerca de 12 vezes menos por token. De acordo com o blog técnico da NVIDIA sobre o V4, a arquitetura híbrida de atenção (CSA + HCA) reduz os FLOPs de inferência para 27% e o cache KV para 10% do que o V3.2 exigia em contexto de 1 milhão. Esses são ganhos arquitetônicos reais, não números de marketing.
Mas ainda não tenho certeza se os benchmarks dizem muito sobre o que acontece quando um agente executa a mesma chamada de ferramenta seis vezes porque as cinco primeiras produziram JSON malformado.
Por que fichas mais baratas importam para agentes
A matemática é simples o suficiente. Quando os tokens de entrada custam \0,14 dólares por milhão, você pode se dar ao luxo de rodar mais experimentos. Mais iterações. Mais soluções candidatas. Mais avaliações passam.
Para fluxos de trabalho de agentes especificamente, isso muda três coisas:
Mais execuções por dólar. Um agente de codificação que faz 1.000 chamadas de API com um prompt de sistema de 2.000 tokens, uma mensagem de usuário de 200 tokens e uma resposta de 300 tokens custa aproximadamente $117,60 no total no Flash V4 — assumindo que o prompt do sistema armazene em cache. Esse mesmo volume em um modelo de entrada/saída $15/$75 custaria mais de $20.000. A lacuna não é sutil.
! [imagem] (https://cdn.10b.ai/1778120217138-2.png)
Menor custo de entrada para experimentação. Se você está construindo um pipeline de agentes e precisa testar se as definições da ferramenta funcionam, se a estrutura do prompt se mantém em casos limite, se seu harness de avaliação detecta as falhas certas — tokens baratos significam que você pode realmente iterar em vez de adivinhar.
Economia de cache recompensa** boa engenharia.** Equipes que estruturam bem seus prompts — prefixos estáveis, exemplos consistentes em poucos shots, conteúdo variável no final — são recompensadas de forma desproporcional. Como a equipe do Hugging Face observou em sua análise V4, a combinação de atenção híbrida e precificação agressiva de cache torna loops de agentes de longo contexto realmente práticos em larga escala.
Fiquei pensando nisso: a vantagem de custo não é só pagar menos. É poder pagar a depuração.
Custos Ocultos Inferência Barata Não Remove
Essa foi a parte com que fiquei um tempo.
Tokens baratos reduzem um item da nota. Mas os custos para agentes não são dominados pelo preço do token. Eles são dominados pelo que acontece quando algo dá errado — e as coisas dão errado com frequência.
Chamadas de ferramenta falhadas
A própria documentação do DeepSeek alerta explicitamente: o modelo pode gerar JSON inválido e pode criar parâmetros inexistentes no seu esquema de função. Você deve validar os argumentos antes de executar qualquer função. Isso não é um problema específico do DeepSeek — todos os modelos fazem isso. Mas em escala de agentes, uma taxa de falha de chamadas de ferramentas de 5% não significa que 5% dos seus custos estão desperdiçados. Significa que 5% das suas chamadas acionam tentativas de repetição, tratamento de erros, re-prompting e, potencialmente, falhas em cascata posteriores.
…esse custo não está na página de preços.
Repetições e depuração contínua
Um agente que tenta novamente um passo que falhou três vezes consome 4x os tokens de um que tem sucesso na primeira tentativa. Tokens de entrada baratos ajudam, mas não resolvem o problema subjacente — que é que o modelo não fez o que você pediu. Se sua lógica de repetição apenas reenvia o mesmo prompt, você está pagando pelo mesmo erro repetidamente.
Percebi esse padrão ao assistir o V4 Flash lidar com tarefas de múltiplos passos. É rápido, barato e, em etapas simples, realmente bom. Mas em etapas que exigem saída estruturada precisa ou orquestração complexa de ferramentas, a taxa de falha foi visivelmente maior que a do V4 Pro. A diferença de custo de 12x entre Flash e Pro começa a se comprimir quando se leva em conta as tentativas de repetição.
Sobrecarga de avaliação
Aqui está uma que quase ninguém considera no orçamento: você ainda precisa avaliar se a saída do agente está correta. Se você estiver usando uma segunda chamada de modelo para verificar a primeira, seu custo efetivo dobra. Se você estiver usando um modelo mais caro como juiz, a vantagem do preço do token desaparece parcialmente.
O anúncio de lançamento do V4 posiciona o Flash como equivalente ao Pro em "tarefas simples de agentes". Esse qualificativo importa. Para codificação agentiva complexa — SWE-bench Pro, que testa cenários complexos de múltiplos passos — o V4 Pro marcou 55,4% contra líderes de código fechado com 64,3%. Essa diferença significa mais tentativas falhas, mais revisão humana, mais ciclos de avaliação.
Latência e confiabilidade
A API do DeepSeek está hospedada principalmente na China. Durante horários de pico, os picos de latência são reais. Para fluxos de trabalho de agentes síncronos, onde cada passo depende do anterior, um pico de latência de 5 segundos a cada terceira chamada se acumula rapidamente — não no custo de tokens, mas no tempo total que sua equipe está aguardando.
Não tenho certeza de como quantificar isso ainda. Mas não parecia desprezível.
O ponto cego dos tokens de raciocínio
Mais uma coisa. A V4 suporta o modo de pensamento, onde o modelo gera tokens de raciocínio internos antes de produzir uma resposta visível. Esses tokens de raciocínio contam para sua conta. Em uma tarefa complexa de agente em múltiplas etapas com o modo de pensamento ativado, o modelo pode gerar de 2.000 a 3.000 tokens de raciocínio antes de produzir uma resposta de 200 tokens. Seu custo efetivo por token de saída visível pode ser 10 vezes maior do que a taxa de saída sugere.
Só percebi isso totalmente quando comecei a monitorar o campo completion_tokens_details nas respostas. A diferença entre o que você vê e o que paga pode ser significativa.
! [imagem] (https://cdn.10b.ai/1778120220285-4.png)
Quando a API DeepSeek v4 é um encaixe forte
Depois de assistir por um tempo, o padrão fica mais claro:
Cargas de trabalho de alto volume e amigas do cache. Se seu agente reutiliza um prompt estável do sistema em milhares de chamadas, cache de contexto pode reduzir os custos efetivos de entrada abaixo de $0,01/M no Flash V4. Análise de repositórios, revisão de código em lote, processamento de documentos — esses são encaixes naturais.
Experimentação e prototipagem. Quando você ainda está tentando descobrir se uma arquitetura de agente realmente funciona, a diferença entre os tokens de entrada $0.14/M e $5/M é a diferença entre "deixa eu testar isso" e "deixa eu pensar se vale a pena testar."
Pipelines não críticos com orçamentos de retentativa. Se seu fluxo de trabalho tolera falhas ocasionais e você já tem lógica de retentativas incorporada, o V4 Flash te dá espaço para absorver essas tentativas sem gastar o orçamento.
Agentes de codificação em tarefas bem definidas. A classificação de Codeforces do V4 Pro de 3.206 e a pontuação do LiveCodeBench de 93,5% são as mais altas entre os modelos open-weight. Para problemas do estilo de programação competitiva e tarefas de codificação contendas, a relação qualidade-custo é difícil de superar.
Quando inferências baratas podem enganar as equipes
… essa é a parte que sempre volto a ela.
Quando você confunde preço baixo de token com baixo custo total. Se o fluxo de trabalho do seu agente tem uma taxa de falha de 15% e cada falha desencadeia duas tentativas mais uma revisão humana, seu custo efetivo por conclusão bem-sucedida pode ser de 3 a 5 vezes o preço bruto do token. A página de preços não pode dizer isso. Apenas seus logs podem.
**Quando você pula a avaliação porque "é barato o suficiente para simplesmente rodar." ** Inferência barata pode criar uma falsa sensação de segurança. Já vi esse padrão: os tokens são tão baratos que as equipes param de medir se os resultados estão realmente corretos. O custo não está no projeto de API — está nas decisões ruins tomadas depois.
Quando o preço promocional se torna sua suposição básica. O desconto de 75% do V4 Pro vai até 31 de maio de 2026. Depois disso, o preço de produção salta de 0,87/M para \3,48/M. Se você está construindo infraestrutura de produção em torno da taxa com desconto, precisa de um plano para o que acontece quando ela terminar.
Quando a latência importa mais do que o custo. Fluxos de trabalho de agentes que precisam de respostas em menos de um segundo para casos de uso interativos podem achar a latência variável do DeepSeek — especialmente de fora da Ásia — mais difícil de contornar do que o preço sugere. Provedores terceirizados como Fireworks e DeepInfra oferecem a V4 por meio de sua própria infraestrutura, com perfis de latência potencialmente melhores, mas adicionam uma margem que reduz a diferença de custos.
Talvez eu esteja pensando demais em algumas coisas. Mas prefiro sinalizar isso agora do que perceber depois.
! [imagem] (https://cdn.10b.ai/1778120222958-5.png)
FAQ
Qual ID de modelo devo usar — deepseek-chat** ou deepseek-v4-flash****?**
Use deepseek-v4-flash ou deepseek-v4-pro diretamente. Os antigos aliases (deepseek-chat, deepseek-reasoner) são direcionados para o Flash V4 por enquanto, mas estão programados para remoção em 24 de julho de 2026.
O desconto de 75% no V4 Pro é permanente?
Não. A página oficial de preços diz que está estendido até 31 de maio de 2026 às 15:59 UTC. Depois disso, os preços de lista se aplicam, a menos que a DeepSeek anuncie outra extensão.
Como faço para maximizar as taxas de acerto no cache?
Coloque seu conteúdo estável — prompt do sistema, definições de ferramentas, exemplos de poucos shots — no início do array de mensagens. O conteúdo variável vai no final. Monitore prompt_cache_hit_tokens em cada resposta da API para medir as taxas reais de acerto, em vez de assumir.
Devo começar com o V4 Flash ou V4 Pro para trabalho com agente?
Comece pelo Flash. Custa 12 vezes menos e tem desempenho dentro de alguns pontos percentuais do Pro na maioria dos benchmarks. Escale para Pro apenas quando sua própria avaliação mostrar que a qualidade do Flash não é suficiente para um tipo específico de tarefa.
Posso ser autônomo da V4?
Ambos os modelos são lançados sob a licença MIT com pesos disponíveis no Hugging Face. O Flash V4 em parâmetros de 284B é viável em uma configuração multi-GPU. O V4 Pro em parâmetros de 1,6T requer capacidade significativa de cluster — a maioria das equipes usará a API para o Pro.
Postagens anteriores:
- Se você está comparando o custo por token com o comportamento real de agentes, isso se conecta diretamente: Por Que o Cache de Prompt Reduz o Custo — Mas Não Cria Memória de Agente
- Para uma análise mais profunda sobre por que falhas de agentes se acumulam além do preço bruto de tokens, leia: Por Que a Engenharia de Contexto Ainda Bate um Limite em Fluxos de Trabalho de Agentes de Longa Duração
- Curioso sobre como a infraestrutura de agentes muda o custo operacional total além do preço de inferência? Veja: Agentes Gerenciados Claude e o Custo Real da Execução de Agentes de Longo Horizonte
- Se você está avaliando inferência barata especificamente para agentes de programação, este guia combina bem: Claude Está Executando Código Devagar? O Gargalo Real Geralmente Não É o Modelo
- Para uma visão mais ampla da arquitetura sobre o que realmente torna os agentes reutilizáveis ao longo do tempo, leia: Habilidades de Agente vs. Ativos GEP: A Diferença Entre Execução e Reutilização de Capacidades




