中国のAIモデルコスト優位性、DeepSeek V4 Flashが世界最安選択肢に

中国の人工知能モデルは、OpenAIやAnthropicなどの最前線モデルとの性能差を驚異的な速度で縮小しており、「性能比」(すなわちタスクコスト)という重要な指標において圧倒的な優位性を示しています。最近、独立したAIモデル評価プラットフォームArtificial Analysis(AA)が発表したデータによると、世界のトップ20のAIモデルの中で、DeepSeek V4 Flashは単一タスクあたりわずか3セントのコストで最も経済的な選択肢となりました。

中国AIモデルが世界市場で顕著な進展を遂げる

長い間、中国のAIモデルは低価格戦略で市場競争に参加してきました。しかし、最近の月之暗面 Kimi K3やアリババのQwen 3.8 Maxなどのモデルのリリースにより、中国のモデルはAAモデル総合知能指数のトップ10に大量に入るようになりました。範囲を拡大してトップ20に目を向けると、先月末に発表されたDeepSeek V4 Flashも同様に名を連ねています。知能指数が60点以上のトップモデルの中で、唯一のオープンウェイトモデルは月之暗面 Kimi K3(60点)です。Kimi K3は現在の知能指数ランキング1位のClaude Opus 5(63点)とわずか3点差で、GPT-5.6 Solとは1点差であり、そのタスクコストはわずか84セントで、最前線モデルの中では比較的低い水準です。

AIモデルのコスト評価において、トークン単価は全体像ではありません。推論モデルは回答前に大量の内部「思考」トークンを消費するため、たとえトークン単価が安価であっても、単一タスクの総体コストは依然として高くなる可能性があります。「タスクコスト」は企業の実際の支出をより反映しており、特定の作業を完了するために必要な総トークン消費量を示します。DeepSeek V4 Flashの知能指数は52点で、OpenAI GPT-5.6 Luna(maxモード)と同等ですが、タスクコストはわずか3セントで、後者の5セントよりも低いです。さらに重要なのは、DeepSeek V4 Flashの初回応答時間(TTFT)が1.17秒で、エンドツーエンドの応答時間が19.49秒であるのに対し、GPT-5.6 Luna(max)のTTFTは135秒以上に達することです。

両者の知能指数とタスクコストは近いですが、DeepSeekの応答速度の優位性は非常に顕著です。

企業のAIモデルに対する需要が継続的に増加

応答速度の比較において、Claude Opus 5は際立った性能を示しています:TTFTは5.92秒、エンドツーエンドの応答時間はわずか14.68秒で、全体の所要時間は同クラスのモデルの4分の1に過ぎません。さらに、DeepSeek V4 Flashはオープンウェイトモデル(MITライセンス)であり、企業が自らホスティングすることを許可していますが、GPT-5.6 LunaはAPI専用です。この違いは実際の展開において開発者の選択に重要な影響を与える可能性があります。

アリババが新たに発表したQwen 3.8 Maxは2.4兆のパラメータを持ち、知能指数は58点で第10位にランクインし、「歴代最強Qwen」というアリババの主張を裏付けています。しかし、そのタスクコストは¥180(US$1.13)で、同クラスの競合製品よりも高くなっています。1セントのタスクコスト範囲内では、GPT-5.6 Luna(lowモード)、MiMo-V2.5、Llama 4 Scoutが含まれています。その中でMiMo-V2.5(知能指数37点)は同価格帯のモデルの中でコストパフォーマンスが最も高いです。

企業のAI支出の急速な増加は業界の一般的な現象となっています。『フォーブス』の5月の報道によると、Uberは開発者がAnthropic Claude Codeを大量に使用したため、2026年のAI予算が4月に全て使い果たされました。約5000人のエンジニアからなる組織の中で、Claude Codeの急速な普及によりAI支出が予想を大幅に超え、Uberはその後、各従業員に月¥238,100(US$1,500)の代理プログラミングツールの使用上限を設定しました。Amazonも同様の困難に直面しており、内部AIプロジェクトはAnthropic Claude Sonnetを利用して商品リストと著者情報の照合を行い、プロジェクトコストは元の予算を860%超え、約180万ドルに達しました。

さらに大きな問題は、トークン使用によるコストの増加が5ヶ月間も適時に発見されなかったことです。

AIモデルが企業内部で急速に普及し、特に代理機能や推論タスクへの移行が進む中、AIトークンのコストが急激に上昇しています。モデル開発者はトークン単価を引き下げたり、「プロンプトキャッシュ」技術を導入したりして対応していますが、キャッシュヒット後も料金が発生し、コンテキストが長くなるほど累積コストが高くなります。キャッシュの無効化(例えば、対話の間隔が5分を超えたり、履歴メッセージが変更されたりすること)は、費用を元の価格で再計算させることになります。AAのインテリジェンスインデックスは、複数の評価の加重結果を統合した複合指標です。タスクコストは、各モデルが複数の評価で実際に消費したトークン量(入力、キャッシュヒット、キャッシュ書き込み、推論、出力を含む)にトークン単価を掛けて計算されます。

なお、この指標はコーディング、数学、科学、代理タスクを基準としており、純粋な翻訳、チャットボット、一般的なオフィスシーンには適用されません。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle