Lena です。この二週間、ある agent workflow を DeepSeek V4 に向けて流し続けて、何が起きるかをひたすら見ていました。短いベンチマークじゃなくて、ただ……普通に走らせて、トークンカウンタを見て、お金が実際どこへ流れていくかを追っていただけです。
価格はほとんど出来すぎている、と思える水準でした。一部はたしかに本当に安い。けれども一部は、見た目どおりではない——数字が間違っているわけではなく、その数字が物語のごく一部しか語っていない、というだけのことです。これは、その過程で気づいたことのメモです。
DeepSeek V4 API が表向き提供しているもの
DeepSeek は 2026 年 4 月 24 日に V4 を preview としてリリースしました。model は二つ、いずれも MoE アーキテクチャ、いずれも 1M トークンの context window を持ち、最大出力は 384K まで届きます。
V4 Pro:総パラメータ 1.6 兆、トークンあたり 49 億をアクティブ化。モデル ID は deepseek-v4-pro。複雑な推論、coding、agentic タスク向けに位置づけられています。今は 2026 年 5 月 31 日まで 75% のプロモ割引が走っていて、プロモ期間中は cache-miss の入力が $0.435 / M トークン 、出力は $0.87 / M トークン。プロモ後はそれぞれ $1.74 と $3.48 に跳ね上がります。
V4 Flash:総 2,840 億、アクティブ 130 億。モデル ID は deepseek-v4-flash。速度とコスト効率を狙って作られていて、価格は $0.14/M 入力 と $0.28/M 出力 ——プロモ不要、これが標準価格です。
両モデルとも thinking / non-thinking モード、tool calls、JSON 出力、OpenAI 互換 API 形式に対応しています。古い deepseek-chat と deepseek-reasoner のエイリアスは 2026 年 7 月 24 日に廃止予定です。
本番投入前に確認しておくべきこと
公式の価格ページを何度か読み返しました。見落としやすいポイントが一つあります:cache-hit の入力価格は 2026 年 4 月 26 日にローンチ価格の 1/10 まで下げられています。V4 Flash では cached input が $0.0028/M——cache-miss と比べて 98% 引きです。V4 Pro はプロモ中、cached input が $0.003625/M。
……これは、見落としていい数字ではありません。
ただ、ここで何度も戻ってきて立ち止まるポイントがあります:cache hit は保証されていない。DeepSeek 自身のドキュメントが caching を best-effort として説明しています。ヒット率を上げるためにプロンプトを工夫することはできる——安定する system prompt を先頭に、変動する内容を末尾に置く——けれど、ヒット率は仮定してはいけない。実測する必要があります。
ベンチマークの数字も強い。V4 Pro は SWE-bench Verified で 80.6%、最良のクローズドソース model との差は 0.2 ポイント以内。V4 Flash は SWE-bench で Pro に対して約 1.6 ポイントほどしか落ちないのに、トークンあたりのコストは約 12 分の 1。NVIDIA の V4 についての技術ブログによれば、hybrid attention アーキテクチャ(CSA + HCA)は 1M context での推論 FLOP を V3.2 比で 27% に、KV cache を 10% にまで削減しているそうです。これはマーケティングの数字ではなく、本物のアーキテクチャの進歩。
ただ、agent が最初の五回 malformed JSON を返したせいで同じ tool call を六回目を走らせる、そういうときに何が起きるかを、ベンチマークがどこまで教えてくれるのかは、僕にはまだよく分からない。
なぜ agent にとって、安いトークンが大事なのか
算数はシンプルです。入力トークンが $0.14 / M なら、できる実験の数が増える。イテレーションも増える。候補解も増える。評価のパスも増える。
具体的に agent workflow にとっては、三つのことが変わります。
一ドルあたり走らせられる回数が増える。 system prompt 2,000 トークン、user message 200 トークン、応答 300 トークンで API を 1,000 回呼ぶ coding agent は、system prompt が cache に乗るとして、V4 Flash 上で総額およそ $117.60 。同じ量を $15/$75 の入出力単価の model で走らせると、$20,000 を超えます。この差は誤差ではない。
実験の入り口コストが下がる。 agent パイプラインを組み立てているとき、tool definitions が機能するか、prompt の構造がエッジケースで耐えるか、評価ハーネスが正しい failure を捕まえているか——そうしたことを確かめたい場面で、安いトークンは「実際にイテレーションする」を「想像で済ませる」に置き換えてくれる。
Cache の経済性は良い engineering を報う。 プロンプトを綺麗に組んでいるチーム——安定した prefix、一貫した few-shot example、変動する内容は末尾——は不釣り合いに報われる。Hugging Face チームの V4 分析が指摘しているとおり、hybrid attention と攻めた cache 価格の組み合わせが、long-context な agent loop を初めて規模で実用にしている。
ずっと頭の中にあったのはこれです:コストの優位性は「支払いが減る」だけの話ではなく、「debugging のための予算を持てる」という話なんだ、と。
安い推論でも消えない隠れコスト
ここはしばらく座って考えていた部分です。
安いトークンは請求書の一行を減らす。けれど agent のコストはトークン価格が支配しているわけではない。何かがうまくいかないときに何が起きるか が支配している——そして、よく、うまくいかない。
失敗する tool call
DeepSeek 自身のドキュメントが明確に警告しています。model は無効な JSON を生成し得る、function schema に定義していない引数を hallucinate し得る、と。何かの function を実行する前に、必ず引数を validate しなければならない。これは DeepSeek 固有の問題ではなく、どの model でも起きること。けれど agent 規模では、tool call の 5% 失敗率は「コストの 5% が無駄になる」という意味ではない。それは「呼び出しの 5% が retry、エラーハンドリング、再 prompt、そして場合によっては下流のカスケード失敗を引き起こす」という意味です。
……このコストは価格ページには書かれていません。
Retry と繰り返しの debugging
失敗ステップを三回 retry する agent は、最初の一回で成功する agent の 4 倍のトークンを焼きます。安い入力トークンは助けにはなるけれど、根本の問題——model が依頼どおりに動かなかったという事実——を直してはくれない。retry のロジックが同じ prompt をもう一度送るだけなら、同じミスに繰り返しお金を払い続けることになる。
V4 Flash がマルチステップタスクを処理するのを見ているうち、このパターンに気づきました。速くて、安くて、まっすぐな手順なら、たしかに良い。けれど精密な構造化出力や複雑な tool オーケストレーションを要するステップでは、失敗率が V4 Pro より目に見えて高かった。retry を勘定に入れると、Flash と Pro の 12 倍のコスト差は、ぐっと縮まり始めます。
評価のオーバーヘッド
これはほとんど誰も予算に組み込んでいない項目です:agent の出力が正しいかどうか、依然として評価する必要がある。最初の出力を二度目の model 呼び出しで検証するなら、実効コストは倍になる。judge にもっと高い model を使うなら、トークン価格の優位性は部分的に蒸発します。
V4 のリリース告知は、Flash を「simple agent tasks」では Pro と同等と位置づけています。この限定詞は重要。より複雑な agentic coding——SWE-bench Pro、つまり難しいマルチステップシナリオを測るほう——では V4 Pro が 55.4%、対するクローズドソースの先頭は 64.3%。この差は、失敗試行が増える、人手レビューが増える、評価サイクルが増える、ということを意味します。
レイテンシと信頼性
DeepSeek の API は主に中国国内でホストされています。ピーク時には latency spike が現実に起きる。同期的な agent workflow——各ステップが前のステップに依存するような——では、3 回に 1 回 5 秒のスパイクが乗るだけで、積み上がりが速い。トークンコストではなく、チームが待っている wall-clock 時間の側で。
これをどう定量化するかは、まだ自分の中で決まっていません。けれど、無視していい大きさには感じませんでした。
Reasoning トークンという死角
もう一つ。V4 は thinking mode をサポートしていて、可視応答を出す前に内部 reasoning トークンを生成します。これらの reasoning トークンも請求対象です。thinking mode を有効にした複雑なマルチステップ agent タスクでは、200 トークンの回答を出す前に 2,000〜3,000 の reasoning トークンを生成することがある。「目に見える出力トークン」あたりの実効コストは、出力単価が示す数字の 10 倍に達することすらある。
このことを本当に理解したのは、応答内の completion_tokens_details フィールドを監視し始めてからでした。「自分が見ているもの」と「自分が払っているもの」の差は、無視できないことがある。
DeepSeek V4 API がしっかりハマるとき
しばらく観察していると、パターンが見えてきます。
高頻度で cache に親和性のあるワークロード。 agent が数千回の呼び出しで安定した system prompt を再利用するなら、context caching が V4 Flash の実効入力単価を $0.01/M を切るところまで押し下げる。リポジトリ解析、バッチでのコードレビュー、ドキュメント処理——これらは自然に向いている。
実験とプロトタイプ段階。 agent アーキテクチャがそもそも機能するかを確かめている時期、$0.14/M と $5/M の差は「とりあえず試してみよう」と「試す価値があるかをまず考えよう」の差になります。
retry 予算のある非クリティカルなパイプライン。 ワークフローが時々の失敗を許容でき、retry ロジックを組み込んでいるなら、V4 Flash は予算を吹き飛ばさずに retry を吸収する余裕をくれる。
定義の明確な coding agent。 V4 Pro の Codeforces レーティング 3,206、LiveCodeBench 93.5% は、open-weight model の中で最高水準。競技プログラミング風の問題、境界がはっきりしている coding タスクには、品質対コスト比で打ち破りにくい組み合わせ。
安い推論がチームをミスリードしうるとき
……ここが、何度も戻ってきてしまう部分です。
「安いトークン価格」を「安い総コスト」と取り違えるとき。 agent workflow に 15% の失敗率があり、各失敗が 2 回の retry と 1 回の人手レビューを引き起こすなら、「成功 1 件あたり」の実効コストは生のトークン価格の 3〜5 倍になり得る。価格ページはこれを教えてくれない。あなたのログだけが教えてくれる。
「安いから走らせちゃおう」で評価をスキップするとき。 安い推論は、偽の安心感を作り出すことがある。このパターンを見たことがあります——トークンが安すぎて、出力が実際に正しいかどうかをチームが測らなくなる。コストは API 請求書の中ではなく、その下流で行われる悪い意思決定の中にある。
プロモ価格をベースラインの前提にしてしまうとき。 V4 Pro の 75% 割引は 2026 年 5 月 31 日まで。そのあと、出力価格は $0.87/M から $3.48/M に跳ね上がる。割引価格の前提で本番インフラを組み立てているなら、終わったときに何が起きるかの計画が必要です。
コストよりレイテンシのほうが重要なとき。 サブセカンドの応答を要するインタラクティブな agent workflow は、DeepSeek の変動するレイテンシ——とくにアジア外からのアクセス——を、価格が示唆するよりも回避しづらいと感じるかもしれません。Fireworks や DeepInfra のようなサードパーティ provider が自前のインフラで V4 を提供していて、レイテンシのプロファイルはより安定し得るけれど、上乗せ分でコスト差は縮みます。
ここは僕が考えすぎているのかもしれません。けれど、後になって気づくよりは、今フラグを立てておきたい。
FAQ
どのモデル ID を使えばいい——deepseek-chatそれともdeepseek-v4-flash?
直接 deepseek-v4-flash か deepseek-v4-pro を使ってください。古いエイリアス(deepseek-chat、deepseek-reasoner)は当面 V4 Flash にルーティングされますが、2026 年 7 月 24 日に廃止予定です。
V4 Pro の 75% 割引は永続ですか?
いいえ。公式の価格ページには 2026 年 5 月 31 日 15:59 UTC までの延長と明記されています。それ以降はリスト価格が適用される。DeepSeek が再延長を発表すれば別ですが。
Cache のヒット率はどうやって最大化する?
安定する内容——system prompt、tool definitions、few-shot examples——を message 配列の先頭に。変動する内容を末尾に。各 API 応答の prompt_cache_hit_tokens を監視して、仮定ではなく実測でヒット率を見る。
Agent の作業は V4 Flash と V4 Pro、どちらから始めるべき?
Flash から。コストは 12 分の 1 で、ほとんどのベンチマークで Pro と数ポイント差。あなた自身の評価で「特定のタスク種別では Flash の品質が足りない」と分かったときだけ Pro に上げる。
V4 を自分でホストできますか?
両モデルとも MIT ライセンスで、Hugging Face に重みが置かれています。V4 Flash の 2,840 億パラメータはマルチ GPU 構成で現実的。V4 Pro の 1.6 兆パラメータは相当規模のクラスタが要る——多くのチームは Pro については API を使うことになるはず。
Previous Posts:
- トークンコストと現実の agent の振る舞いを並べて見たい人には、こちらが直接つながります:Why Prompt Caching Reduces Cost — But Doesn't Create Agent Memory
- agent の失敗が、生のトークン価格を超えてどのように積み上がっていくかをもっと深く見たいなら:Why Context Engineering Still Hits a Ceiling in Long-Running Agent Workflows
- agent のインフラが、推論価格を超えた総運用コストをどう変えるのかが気になるなら:Claude Managed Agents and the Real Cost of Long-Horizon Agent Runtime
- coding agent に対して安い推論を評価しているなら、合わせて読むのにちょうどいいのがこちら:Claude Code Running Slow? The Real Bottleneck Usually Isn't the Model
- 何が agent を時間軸で再利用可能にするのかについて、より広いアーキテクチャの視点が欲しいなら:Agent Skills vs GEP Assets: The Difference Between Execution and Capability Reuse




