DeepSeek-V4.1 カバー画像

DeepSeek が DeepSeek-V4.1 を投入 ── 1MトークンでもKVキャッシュが1/4に

DEEPSEEKOSS

最終更新: 2026年09月12日 06:34 元記事 →

552Bパラメータのモデルで100万トークンコンテキスト、しかも推論コストは大幅カット。DeepSeekの最新フラグシップは、単なる規模拡大ではなく「メモリ効率」への極端なこだわりが際立っている。エンジニア視点で見ると、これはエージェント実装の足枷を取り払う一手になりそうだ。

何が変わったのか

まず目立つのがCausal Encoder-Decoder (CED) アーキテクチャの採用だ。40層のTransformerを20層のエンコーダと20層のデコーダに分け、デコーダのKVキャッシュをエンコーダの最終層から投影する仕組みにしている。これにより、プリフィル時(入力処理)はトークンあたり8B、デコード時(生成)は16Bのパラメータしか活性化する。さらにCompressed Sparse Attention 2 (CSA2) とFP4形式のKVキャッシュ(E2M1)を組み合わせ、グローバルKVキャッシュのフットプリントを1トークンあたり890バイトに圧縮。これは前のモデルDeepSeek-V4-Flashの約1/4という計算になる。加えて、SWA Bounded Replayという技術でSliding Window AttentionのKV状態をSSDへ永続化せずに再構築し、永続KVキャッシュの容量をさらに1/8まで削減している点も特徴的だ。

前モデル / 競合との比較

提供テキストでは、DeepSeek-V4-Flashと比較してグローバルKVキャッシュのフットプリントが約1/4、SWA KVキャッシュの永続化フットプリントが約1/8に削減されたと明記されている。また、552Bのバックボーンパラメータに対し、トークンあたり8B/16Bのパラメータ活性化というMoEの効率性が強調されている。競合他社との直接的なベンチマーク比較はテキストにないが、メモリ効率面では既存の超長文対応モデルより大幅に有利な位置づけと推測できる。

技術背景と意義

LLMの長文処理において、メモリ(KVキャッシュ)の消費はコストと速度のボトルネックになりがちだ。DeepSeek-V4.1-Flashは、エンコーダ層で情報を圧縮・整理してからデコーダに渡すことで、生成段階で保持すべきデータを最小限に抑えている。特にCSA2は、アテンションの計算パターンを「Full」「Reindex」「Reuse」の3つのモードに静的に割り当て、不要な計算を省く設計。これにより、超長文コンテキストを扱ってもメモリ肥大化を抑制し、推論サーバーの負荷を軽くしている。

こんな人・用途に

・大量の文書やコードベースを一度に読み込み、要約や分析を行うエージェント型ワークフロー
・長期的な会話履歴を保持しながら、応答速度とコストを最適化したチャットボット構築
・画像とテキストを統合的に処理し、複雑なマルチモーダルタスクを低コストで実行したい開発者

Hacker Newsの反応

技術的な評価は非常に高く、特にKVキャッシュ圧縮への注目が集まっている。一方で、モデルサイズが以前より増えたことへの懸念も混じるが、コストパフォーマンスの良さには概ね好意的な声が多い。

Hacker News

「HuggingFaceで入手可能。ただ元のv4 Flashが284Bで、ローカルで回すにはまだ少し厳しいサイズ感が残る。」

u/revolvingthrow
Hacker News

「性能がかなり強力で、価格も引き下げたため、メインのサブスクが切れたときの強力なバックアップとして優秀だ。」

u/LaurensBER
Hacker News

「技術レポート5ページの図示されている数値は、かなり驚異的なレベルに達している。」

u/E-Reverance
Hacker News

「コストが下がったのは本当か?OpenRouterでのキャッシュヒット時の実効価格は1Mあたり4セント程度だ。」

u/dyl000
Hacker News

「ビジョン機能ではGLM 5.3 Flashに一歩譲るものの、視覚処理が必要なら十分に使えるモデルだと思う。」

u/minimaxir

入手方法・リンク

Hugging Face上で公開されている。オープンソース(OSS)として提供されているため、ダウンロードしてローカルまたはクラウド上で推論環境を構築できる。GitHubリポジトリへの直接リンクは提供テキストにないが、Hugging Faceのモデルページからアクセスポイントを確認できる。

Redditの反応

Hacker Newsでは、DeepSeek v4.1の「非検閲版」への関心が集まっている。自宅サーバーでの検証報告や、AIの倫理調整に対する多様な意見が交わされており、技術的な純粋性を求める声が目立つ。

Hacker News

「自宅にマルチGPUクラスタがあって実際に試した人いる?性能や挙動の報告を聞きたいな。」

u/pgsandstrom
Hacker News

「dealign.aiなどデアルイニング系の動きを批判する声もあるけど、個人的には全面支持。LLLMに社会的影響があるなら、制限されていない選択肢があるべきだと考えている。」

u/crooked-v
Hacker News

「完璧な蒸留(ディストリビューション)だと思う。元のモデルの能力をうまく引き出せている。」

u/dude250711

SOURCE: DeepSeek (2026-09-10)

← LLM Watch トップへ

類似投稿

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です