DeepSeekが2026年9月10日、新しいAIモデル「DeepSeek V4.1 Flash」を正式公開しました。
総パラメータ数は552B(5520億)のMoEモデルですが、入力時に活性化するのは8B、出力時は16B。KVキャッシュも前世代から大幅に削減しています。
さらに9月14日からは、V4 Pro向けのAPIリクエストをV4.1 Flashへ順次切り替えます。「巨大モデルの全部を毎回動かさない」構造が、料金にもどう表れているのか見ていきます。
9月14日からV4 Pro APIを代替
V4.1 Flashはネイティブの画像理解にも対応し、DeepSeek APIではすでに deepseek-flash のモデル名で利用できます。
日本時間9月14日13時からは、deepseek-v4-pro に送られたリクエストもV4.1 Flashへルーティングされ、Flashの料金が適用されます。これは将来V4.1 Proが登場するまで続く予定です。
DeepSeekの発表によると、複数者によるテストでV4.1 FlashはV4 Proを性能、コスト、速度、総所要時間で上回ったとしています。
ただし、これはDeepSeekが公表した評価です。あらゆる用途でV4 Proより優れることが独立して保証されたわけではありません。
552Bでも入力時に動くのは8B
V4.1 Flashは、新しい「Causal Encoder–Decoder」と呼ばれる非対称構造を採用しています。
モデル全体では552Bパラメータを持つMoE(Mixture of Experts)ですが、入力側で活性化するのは8B、出力側では16Bです。
MoEは、多数のパラメータを持ちながら、処理ごとに必要な一部を選んで使う仕組みです。
そのため「552Bすべてを毎回計算する」モデルではありません。一方、8Bだけが活性化するからといって、一般的な8Bモデルと同じメモリやハードウェア要件になるという意味でもありません。
KVキャッシュはHBM 1/4、SSD 1/8
もう一つの特徴がKVキャッシュの削減です。
DeepSeekによると、前世代と比べて必要量は、
- HBM:4分の1
- SSD:8分の1
まで縮小しました。
KVキャッシュは、長い会話やAIエージェントで過去の文脈を効率よく再利用するためのデータです。
長いコンテキストを維持しながら何度もモデルを呼び出す用途では、演算性能だけでなくキャッシュの保存・読み出しコストも効いてきます。V4.1 Flashは、ここを小さくすることでエージェント用途のコスト低減を狙っています。

API料金はV4 Proより約70〜86%安い
2026年9月11日時点の公式料金を、ピーク時間帯で比較すると次の通りです。
| 1Mトークン当たり | V4.1 Flash | V4 Pro | Flashの差 |
|---|---|---|---|
| 入力・キャッシュヒット | 0.006ドル | 0.044ドル | 約86%安 |
| 入力・キャッシュミス | 0.30ドル | 1.32ドル | 約77%安 |
| 出力 | 1.20ドル | 3.96ドル | 約70%安 |
オフピーク料金はそれぞれピーク時の半額です。
特にキャッシュヒット時の入力料金はV4 Proの約7分の1。長時間動かすコーディングエージェントなどでは、利用量によって大きな差になります。
なお、API料金はDeepSeekが設定するサービス価格です。8B/16Bの活性化パラメータ数から、実際の推論原価をそのまま逆算できるわけではありません。
Redditでは速さを評価、Pro代替には慎重論も
Redditのr/DeepSeekでは、正式公開を共有した投稿が9月11日8時台の確認時点で376票を集めています。
実際に使ったユーザーから速度を評価する声がある一方、「V4.1 Flashが本当にV4 Proと競えるのか」と慎重に見る反応も出ています。
公開前の個人テストでは、旧V4 Flash Vision Expとの同一課題比較で、V4.1 Flashが約38%短時間で終了し、総トークン数も約43%少なかったという報告もありました。
ただし投稿者自身が、完了状況にも差があり統制されたベンチマークではないと説明しています。実利用での品質は、用途ごとに確認する必要があります。
注目は9月14日以降の実利用
今回の特徴は、552Bというモデル全体の大きさ以上に、必要な部分だけを動かし、KVキャッシュも小さくする設計です。
しかもDeepSeekは、V4 Pro向けAPIをV4.1 Flashへ切り替えるところまで踏み込みます。
V4 Proを使っている開発者にとっては、9月14日の切り替え前後で同じ処理を試し、品質、速度、トークン量、料金がどう変わるかを比べるのが最も分かりやすい検証になりそうです。
参照した一次情報
- 発表元:DeepSeek
- 資料名:Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient.
- 発表日:2026年9月10日
- 発表元:DeepSeek
- 資料名:Models & Pricing
- 更新日:日付表記なし(2026年9月11日確認)
参照したネット反応
- Reddit r/DeepSeek
- 投稿:DeepSeek-V4.1-Flash Release (official)
- 確認時:376票(2026年9月11日8時台)
- Reddit r/DeepSeek
- 投稿:DeepSeek V4.1 Flash vs V4 Flash Vision Exp: 38% faster and 43% fewer tokens in my quick coding test
- 内容:個人による簡易比較。統制されたベンチマークではない

