DeepSeek「V4.1 Flash」公開 552Bでも入力8B、V4 Pro APIを9月14日から代替

多数の演算ブロックの一部だけが動作するMoE型AIモデルを表現したイメージ AI・テクノロジー

DeepSeekが2026年9月10日、新しいAIモデル「DeepSeek V4.1 Flash」を正式公開しました。

総パラメータ数は552B(5520億)のMoEモデルですが、入力時に活性化するのは8B、出力時は16B。KVキャッシュも前世代から大幅に削減しています。

さらに9月14日からは、V4 Pro向けのAPIリクエストをV4.1 Flashへ順次切り替えます。「巨大モデルの全部を毎回動かさない」構造が、料金にもどう表れているのか見ていきます。

9月14日からV4 Pro APIを代替

V4.1 Flashはネイティブの画像理解にも対応し、DeepSeek APIではすでに deepseek-flash のモデル名で利用できます。

日本時間9月14日13時からは、deepseek-v4-pro に送られたリクエストもV4.1 Flashへルーティングされ、Flashの料金が適用されます。これは将来V4.1 Proが登場するまで続く予定です。

DeepSeekの発表によると、複数者によるテストでV4.1 FlashはV4 Proを性能、コスト、速度、総所要時間で上回ったとしています。

ただし、これはDeepSeekが公表した評価です。あらゆる用途でV4 Proより優れることが独立して保証されたわけではありません。

552Bでも入力時に動くのは8B

V4.1 Flashは、新しい「Causal Encoder–Decoder」と呼ばれる非対称構造を採用しています。

モデル全体では552Bパラメータを持つMoE(Mixture of Experts)ですが、入力側で活性化するのは8B、出力側では16Bです。

MoEは、多数のパラメータを持ちながら、処理ごとに必要な一部を選んで使う仕組みです。

そのため「552Bすべてを毎回計算する」モデルではありません。一方、8Bだけが活性化するからといって、一般的な8Bモデルと同じメモリやハードウェア要件になるという意味でもありません。

KVキャッシュはHBM 1/4、SSD 1/8

もう一つの特徴がKVキャッシュの削減です。

DeepSeekによると、前世代と比べて必要量は、

  • HBM:4分の1
  • SSD:8分の1

まで縮小しました。

KVキャッシュは、長い会話やAIエージェントで過去の文脈を効率よく再利用するためのデータです。

長いコンテキストを維持しながら何度もモデルを呼び出す用途では、演算性能だけでなくキャッシュの保存・読み出しコストも効いてきます。V4.1 Flashは、ここを小さくすることでエージェント用途のコスト低減を狙っています。

DeepSeek V4.1 Flashの552B総パラメータと入力8B・出力16Bの活性化、KVキャッシュ削減を示した図

API料金はV4 Proより約70〜86%安い

2026年9月11日時点の公式料金を、ピーク時間帯で比較すると次の通りです。

1Mトークン当たり V4.1 Flash V4 Pro Flashの差
入力・キャッシュヒット 0.006ドル 0.044ドル 約86%安
入力・キャッシュミス 0.30ドル 1.32ドル 約77%安
出力 1.20ドル 3.96ドル 約70%安

オフピーク料金はそれぞれピーク時の半額です。

特にキャッシュヒット時の入力料金はV4 Proの約7分の1。長時間動かすコーディングエージェントなどでは、利用量によって大きな差になります。

なお、API料金はDeepSeekが設定するサービス価格です。8B/16Bの活性化パラメータ数から、実際の推論原価をそのまま逆算できるわけではありません。

Redditでは速さを評価、Pro代替には慎重論も

Redditのr/DeepSeekでは、正式公開を共有した投稿が9月11日8時台の確認時点で376票を集めています。

実際に使ったユーザーから速度を評価する声がある一方、「V4.1 Flashが本当にV4 Proと競えるのか」と慎重に見る反応も出ています。

公開前の個人テストでは、旧V4 Flash Vision Expとの同一課題比較で、V4.1 Flashが約38%短時間で終了し、総トークン数も約43%少なかったという報告もありました。

ただし投稿者自身が、完了状況にも差があり統制されたベンチマークではないと説明しています。実利用での品質は、用途ごとに確認する必要があります。

注目は9月14日以降の実利用

今回の特徴は、552Bというモデル全体の大きさ以上に、必要な部分だけを動かし、KVキャッシュも小さくする設計です。

しかもDeepSeekは、V4 Pro向けAPIをV4.1 Flashへ切り替えるところまで踏み込みます。

V4 Proを使っている開発者にとっては、9月14日の切り替え前後で同じ処理を試し、品質、速度、トークン量、料金がどう変わるかを比べるのが最も分かりやすい検証になりそうです。

参照した一次情報

参照したネット反応

タイトルとURLをコピーしました