我係 Lena。過去兩個禮拜我將一個 agent workflow 駁去 DeepSeek V4 度跑,睇下會發生啲乜。唔係跑一輪 quick benchmark。就係……將啲嘢跑起,盯住 token 計數器,跟住啲錢究竟去咗邊。
啲價錢睇落幾乎好到唔似真。一部分嘅確係。但係有一部分唔係佢表面睇落嗰種樣——唔係話啲數字寫錯,而係啲數字只係講咗故事嘅一半。呢個就係我留意到嘅嘢。
DeepSeek V4 API 表面上提供啲乜
DeepSeek 喺 2026 年 4 月 24 日 ship 咗 V4 嘅 preview 版本。兩個 model,都係 MoE 架構,都係 1M-token 嘅 context window ,最大輸出去到 384K。
V4 Pro:1.6 萬億總參、每 token 激活 49 億。模型 ID 係 deepseek-v4-pro。定位係複雜推理、coding、agentic 任務。而家有一輪 75% 嘅促銷折扣,去到 2026 年 5 月 31 日——促銷期內,cache-miss 嘅輸入價係 $0.435 / M token ,輸出 $0.87 / M token。促銷之後,呢兩個價會分別跳到 $1.74 同 $3.48。
V4 Flash:2840 億總參、激活 130 億。模型 ID 係 deepseek-v4-flash。為咗速度同成本效率而設計。定價 $0.14/M 輸入 同 $0.28/M 輸出 ——唔使任何折扣,呢個就係標準價。
兩個 model 都支援 thinking 同 non-thinking 模式、tool calls、JSON 輸出,同埋 OpenAI 兼容嘅 API 格式。舊嗰啲 deepseek-chat 同 deepseek-reasoner 別名,計劃喺 2026 年 7 月 24 日落線。
上 production 之前必須驗證嘅嘢
我將官方定價頁睇咗好幾次。有一樣好易漏咗嘅嘢:cache-hit 嘅輸入價喺 2026 年 4 月 26 日畀人砍到發布價嘅 1/10 。喺 V4 Flash 上面,cached input 係 $0.0028/M——比 cache-miss 平咗 98%。V4 Pro 喺促銷期內,cached input 係 $0.003625/M。
……呢個係一個唔細嘅、唔應該畀人忽略嘅數字。
但係有件事我反覆諗返:cache hit 唔係有保證嘅。DeepSeek 自己嘅文檔將 caching 講成 best-effort。你可以將 prompt 結構整成對命中率友好嘅樣——穩定嘅 system prompt 擺最前、變動嘅內容擺最後——但係你唔可以假設一個 hit rate。你必須實測。
啲 benchmark 數字都好硬。V4 Pro 喺 SWE-bench Verified 上面攞到 80.6%,同最強嘅閉源 model 之間差咗只係 0.2 分。V4 Flash 喺 SWE-bench 上比 Pro 落後大概 1.6 分,但係每 token 成本平咗大約 12 倍。根據 NVIDIA 關於 V4 嘅技術博客,hybrid attention 架構(CSA + HCA)將 inference FLOP 拉低到 V3.2 喺 1M context 嗰時所需嘅 27%,KV cache 拉低到 10%。呢啲係真嘅架構層面嘅進步,唔係 marketing 數字。
不過我仲係未敢肯定 benchmark 講得到幾多嘢:當一個 agent 因為頭五次都返咗 malformed JSON、於是將同一個 tool call 跑咗第六次嗰陣,會發生乜?
點解對 agent 嚟講,平嘅 token 重要
數學夠簡單。當輸入 token 係 $0.14 / M 嗰陣,你跑得起更多 experiment。更多 iteration。更多候選解。更多 evaluation pass。
具體到 agent workflow,呢樣嘢改變咗三件事:
每一蚊跑得到嘅次數多咗。 一個 coding agent,調用 1,000 次 API,system prompt 2,000 token、user message 200 token、response 300 token,假設 system prompt 命中咗 cache,喺 V4 Flash 上面總價大約係 $117.60 。同樣呢個量,跑去 $15/$75 嘅 input/output model 上面,要 $20,000 以上。呢個差距唔細微。
做 experiment 嘅入門成本低咗。 如果你喺度搭一個 agent pipeline,要測你個 tool definitions 得唔得、prompt 結構喺邊界 case 撐唔撐到、evaluation harness 有冇捉啱啲 failure——平嘅 token 即係話你真係去得起 iterate,唔使靠估。
Cache 經濟學獎勵好嘅工程能力。 將 prompt 整得齊整嘅團隊——穩定嘅 prefix、一致嘅 few-shot example、變動內容擺最後——會被唔成比例咁獎勵。正如 Hugging Face 團隊喺佢哋嘅 V4 分析入面講,hybrid attention 加埋激進嘅 cache 定價,令 long-context 嘅 agent loop 第一次喺規模上真係跑得起。
我反覆諗返呢件事:成本上嘅優勢唔淨止係使少啲錢。係佢令你買得起 debugging 嘅開銷。
平嘅推理消除唔到嘅匿埋成本
呢段我坐咗一陣。
平嘅 token 減咗嘅係單嘅其中一行。但係 agent 嘅成本唔係由 token 價主導。係由啲嘢出錯時會發生乜 主導——而啲嘢成日出錯。
失敗嘅 tool call
DeepSeek 自己嘅文檔明確警告:model 可能生成無效嘅 JSON、可能 hallucinate 出你 function schema 入面冇定義過嘅參數。你必須喺執行任何 function 之前 validate 啲參數。呢個唔係 DeepSeek 獨有嘅問題——每個 model 都係咁。但係喺 agent 規模下,5% 嘅 tool call 失敗率唔係話你嘅成本浪費咗 5%。佢嘅意思係,你 5% 嘅調用會觸發 retry、error handling、重新 prompt,仲可能下游級聯失敗。
……呢部分成本唔喺定價頁度。
Retry 同反覆 debugging
一個失敗咗要 retry 三次嘅 agent,比第一次就成功嗰個多燒 4 倍 token。平嘅輸入 token 有幫助,但係佢冇修返底嗰個問題——model 冇按你要求嗰樣去做。如果你嘅 retry 邏輯係將同一個 prompt 再發一次,你就係喺度為同一個錯誤反覆畀錢。
睇住 V4 Flash 處理多步任務嗰陣,我留意到呢個 pattern。佢快、佢平,喺直白嘅步驟上面,佢真係好。但係喺嗰啲要精確結構化輸出、或者複雜 tool orchestration 嘅步驟上面,佢嘅失敗率比 V4 Pro 明顯高一截。一旦將 retry 計入去,Flash 同 Pro 之間 12 倍嘅成本差就開始壓縮。
Evaluation 嘅開銷
呢樣嘢幾乎冇人喺預算入面預咗位:你仲係要評估 agent 個輸出啱唔啱。如果你用第二次 model call 去驗證第一次嘅輸出,你嘅有效成本就翻倍。如果你攞一個更貴嘅 model 去做 judge,token 嘅價格優勢會被部分蒸發。
V4 嘅發布公告將 Flash 定位成喺 "simple agent tasks" 上同 Pro 表現相當。呢個限定詞好重要。喺更複雜嘅 agentic coding——SWE-bench Pro,嗰種測更難多步場景——V4 Pro 攞咗 55.4%,對面閉源領先者係 64.3%。呢個 gap 即係話更多失敗嘗試、更多人手 review、更多 evaluation 循環。
延遲同穩定性
DeepSeek 嘅 API 主要 host 喺中國境內。喺高峰時段,latency spike 係真嘅。對於同步嘅 agent workflow,每一步都要靠上一步嗰種,每三次調用入面有一次延遲跳到 5 秒,加埋就好恐怖——唔係喺 token 成本入面,而係喺團隊等緊嘅 wall-clock 時間入面。
我而家仲係未諗清楚點 quantify 呢樣嘢。但佢感覺唔可以忽略。
Reasoning token 嘅盲區
仲有一樣。V4 支援 thinking mode:model 喺產出可見 response 之前會生成內部 reasoning token。呢啲 reasoning token 係要計錢嘅。一個開咗 thinking mode 嘅複雜多步 agent 任務,可能喺產出 200 token 嘅答案之前,先生成 2,000–3,000 個 reasoning token。你按「睇得見嘅輸出 token」去計嘅有效成本,可能比 output rate 顯示嘅高 10 倍。
我自己都係喺開始監控 response 入面嗰個 completion_tokens_details field 之後,至意識到呢樣。你睇到嘅同你畀錢嘅,可以差好遠。
DeepSeek V4 API 啱嘅場景
睇咗一段時間之後,pattern 變得清楚:
高頻、對 cache 友好嘅工作負載。 如果你嘅 agent 喺幾千次調用入面共用同一個穩定嘅 system prompt,context caching 可以將 V4 Flash 嘅有效輸入價壓到 $0.01/M 以下。Repository 分析、批量代碼 review、文檔處理——呢啲都係天然啱。
Experiment 同原型階段。 當你仲喺度搞清楚一個 agent 架構究竟得唔得嗰陣,$0.14/M 同 $5/M 之間嘅差,係「等我測下」同「等我先諗下測試值唔值」之間嘅差。
有 retry 預算嘅非關鍵 pipeline。 如果你嘅 workflow 容忍得到偶發失敗、亦都寫咗 retry 邏輯,V4 Flash 畀咗你足夠空間去吸收呢啲 retry,唔會將預算燒爆。
任務定義清晰嘅 coding agent。 V4 Pro 嘅 Codeforces 評分 3,206、LiveCodeBench 攞 93.5%,係 open-weight model 入面最高嘅。對於競賽風格嘅題、同邊界清楚嘅 coding 任務,質量價格比好難打得贏。
平嘅推理幾時會誤導團隊
……呢段就係我反覆返到嗰度嗰段。
當你將「平嘅 token 價」當成「平嘅總成本」。 如果你嘅 agent workflow 有 15% 失敗率、而每次失敗都會觸發兩次 retry 加一次人手 review,你「每次成功完成」嘅有效成本可能係原始 token 價嘅 3–5 倍。定價頁話你唔到呢樣嘢。淨係你嘅 log 先講得到。
當你因為「平到可以直接跑」而跳過咗 evaluation。 平嘅推理會整出一種虛假嘅安全感。我見過呢個 pattern:token 平到團隊唔再去測啲輸出究竟啱唔啱。代價唔喺 API 單度——佢喺下游因此做出嘅壞決定度。
當你將促銷價當成 baseline 假設。 V4 Pro 嘅 75% 折扣去到 2026 年 5 月 31 日截止。之後,輸出價由 $0.87/M 跳到 $3.48/M。如果你按打折價去搭緊 production 基礎設施,你需要一個「折扣完咗之後點算」嘅方案。
當延遲比成本重要。 嗰啲要次秒級回應嘅交互式 agent workflow,可能會發現 DeepSeek 不穩定嘅延遲——尤其係由亞洲以外去訪問——比定價頁暗示嘅更難繞開。Fireworks、DeepInfra 呢啲第三方 provider 用自己嘅基建提供 V4,延遲可能更可控,但佢哋會加一筆 markup,將成本差距收窄。
我可能呢部分諗多咗。但係我寧願而家就 flag 出嚟,都唔想之後先反應到。
FAQ
應該用邊個 model ID——deepseek-chat定deepseek-v4-flash?
直接用 deepseek-v4-flash 或者 deepseek-v4-pro。舊嗰啲 alias(deepseek-chat、deepseek-reasoner)暫時會路由去 V4 Flash,但係計劃喺 2026 年 7 月 24 日落線。
V4 Pro 嘅 75% 折扣係咪永久?
唔係。官方定價頁寫明延長到 2026 年 5 月 31 日 15:59 UTC。之後恢復 list price,除非 DeepSeek 再公告一次延期。
點樣將 cache 命中率拉到最高?
將穩定內容——system prompt、tool definitions、few-shot examples——擺喺 message 數組嘅最前。變動內容擺最後。喺每一次 API response 度盯實 prompt_cache_hit_tokens,去測真實 hit rate,而唔係去假設。
做 agent 應該由 V4 Flash 開始定 V4 Pro 開始?
由 Flash 開始。佢平 12 倍,喺大多數 benchmark 上同 Pro 只差幾個百分點。淨係當你自己嘅 evaluation 顯示某類任務上 Flash 質量唔夠,先升上 Pro。
可唔可以自己 host V4?
兩個 model 都按 MIT license 發布,權重喺 Hugging Face 攞得到。V4 Flash 2840 億參,多 GPU 配置下可行。V4 Pro 1.6 萬億參,要相當規模嘅集群——大多數團隊會用 API 嚟跑 Pro。
Previous Posts:
- 如果你而家喺度將 token 成本同真實 agent 行為對照,呢篇直接接得上:Why Prompt Caching Reduces Cost — But Doesn't Create Agent Memory
- 想更深入睇 agent 失敗點解會喺 token 價之外複利累積?讀呢篇:Why Context Engineering Still Hits a Ceiling in Long-Running Agent Workflows
- 好奇 agent 基礎設施會點樣改變 inference 價之外嘅總運營成本?睇:Claude Managed Agents and the Real Cost of Long-Horizon Agent Runtime
- 如果你具體想評估 coding agent 用平推理嘅可行性,呢篇配住讀好順:Claude Code Running Slow? The Real Bottleneck Usually Isn't the Model
- 想要一個更宏觀嘅架構視角,睇清楚究竟乜嘢令 agent 喺時間維度上可以複用:Agent Skills vs GEP Assets: The Difference Between Execution and Capability Reuse




