DeepSeek、V4.1-Flash AIモデルを発表 – 推論速度とコスト効率を向上

DeepSeekは最近、新世代のAIモデルV4.1-Flashを発表しました。公式の説明によると、V4.1-Flashは総パラメータ規模とアクティベーションパラメータがV4-Proよりも低いものの、性能、推論速度、コスト管理においてはより優れた結果を示しており、特にインテリジェントエージェントやプログラミング関連のタスクにおいて、一部のベンチマークテストの結果はV4-ProやGPT-5.6 Solなどの最先端モデルを上回っています。

DeepSeek V4.1-Flashは性能とコストにおいて優れた結果を示す

DeepSeekは、V4.1-Flashがエキスパートミックスアーキテクチャを採用しており、総パラメータは5520億、入力段階のアクティベーションパラメータは80億、出力段階は160億であると述べています。これに対し、前世代のV4-Flashの総パラメータは2840億、V4-Proの総パラメータは1.6兆に達しています。このモデルの主な改善点は、KVキャッシュを大幅に圧縮したことで、キャッシュの占有が各トークンあたり約890バイトに減少し、出力速度は毎秒約214.4トークンに達し、最初のトークンの応答時間は1.13秒です。

独立評価機関AAは「速度が顕著に速い」と評価しています。

性能面では、DeepSeekはV4.1-Flashが高推論強度設定下で、エンドユーザー操作、コード修正、自動化タスクなどのテストにおいてGPT 5.6 SolやClaude Opus 5をリードしていると述べています。しかし、より広範な高難易度の汎用推論タスクでは、このモデルの成績は相対的に一般的です。AAのデータによると、V4.1-Flashの総合知能指数は40点で、多くの同類のオープンソースモデルの中央値を上回っていますが、トップの最先端モデルには及びません。

注意すべきは、AAが最近評価システムをアップグレードし、全体の評価基準が明らかに厳しくなったため、多くの高得点モデルのスコアも下がったことです。

価格面では、AAのデータによると、V4.1-Flashの100万入力トークンあたりの価格は¥50(US$0.30)、100万出力トークンあたりの価格は¥190(US$1.20)、総合コストは約¥30(US$0.18)であり、同クラスのモデルの中央値を下回っています。キャッシュヒットの場合、価格は100万トークンあたり¥0(US$0.01)までさらに下がる可能性があります。AAはまた、このモデルの回答が長めで、評価中の出力トークンの総量が同類モデルに比べて明らかに高く、実際の使用における時間とコストに影響を与える可能性があると指摘しています。

技術面では、V4.1-FlashはCEDと呼ばれる新しい構造を導入し、40層のTransformerを20層の因果エンコーダと20層のデコーダに分割し、従来のクロスアテンションによる重複計算を減少させ、CSA2、FP4量子化などの方法を組み合わせてキャッシュとメモリの占有を圧縮しています。全体として、DeepSeekは今回のアップデートでインテリジェントエージェントの実行、コード能力、デプロイコストの最適化に重点を置いています。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle