中国のAIモデルコスト優位性、DeepSeek V4 Flashが世界最安選択肢に

中国の人工知能モデルは、OpenAIAnthropicなどの最前線モデルとの性能差を驚くべき速度で縮小しており、「性能比」(すなわちタスクコスト)という重要な指標において圧倒的な優位性を示しています。最近、独立したAIモデル評価プラットフォームArtificial Analysis(AA)が発表したデータによれば、世界のトップ20のAIモデルの中で、DeepSeek V4 Flashは、単一タスクあたりわずか3セントのコストで最も経済的な選択肢となりました。

中国のAIモデルが世界市場で顕著な進展を遂げる

長年にわたり、中国のAIモデルは低価格戦略で市場競争に参加してきました。しかし、最近の月之暗面Kimi K3やアリババQwen 3.8 Maxなどのモデルのリリースにより、中国のモデルはAAモデル総合知能指数のトップ10に大量に入ることができました。範囲を拡大してトップ20に目を向けると、先月末に発表されたDeepSeek V4 Flashも同様に名を連ねています。知能指数が60点以上のトップモデルの中で、唯一のオープンウェイトモデルは月之暗面Kimi K3(60点)です。Kimi K3は現在の知能指数ランキング1位のClaude Opus 5(63点)とわずか3点差で、GPT-5.6 Solとは1点差であり、そのタスクコストはわずか84セントで、最前線モデルの中では比較的低い水準です。

AIモデルのコスト評価において、トークン単価は全体像を示すものではありません。推論モデルは回答前に大量の内部「思考」トークンを消費するため、トークン単価が安価であっても、単一タスクの総コストは依然として高くなる可能性があります。「タスクコスト」は企業の実際の支出をより反映しており、特定の作業を完了するために必要な総トークン消費量を示します。DeepSeek V4 Flashの知能指数は52点で、OpenAI GPT-5.6 Luna(maxモード)と同等ですが、タスクコストはわずか3セントで、後者の5セントを下回っています。さらに重要なのは、DeepSeek V4 Flashの初回応答時間(TTFT)は1.17秒で、エンドツーエンドの応答時間は19.49秒です。一方、GPT-5.6 Luna(max)のTTFTは135秒以上に達します。

両者の知能指数とタスクコストは近いですが、DeepSeekの応答速度の優位性は非常に顕著です。

企業のAIモデルに対する需要が持続的に増加

応答速度の比較において、Claude Opus 5は際立った性能を示しています:TTFTは5.92秒で、エンドツーエンドの応答時間はわずか14.68秒で、全体の所要時間は同級モデルの4分の1に過ぎません。さらに、DeepSeek V4 Flashはオープンウェイトモデル(MITライセンス)であり、企業が自社でホスティングすることを許可していますが、GPT-5.6 LunaはAPI専用です。この違いは実際の展開において開発者の選択に重要な影響を与える可能性があります。

アリババが新たに発表したQwen 3.8 Maxは、24兆のパラメータを持ち、知能指数は58点で第10位にランクインし、「歴代最強Qwen」というアリババの主張を裏付けています。しかし、そのタスクコストは¥180(US$1.13)で、同等の競合製品よりも高くなっています。1セントのタスクコスト帯域では、GPT-5.6 Luna(lowモード)、MiMo-V2.5、Llama 4 Scoutが名を連ねています。その中でMiMo-V2.5(知能指数37点)は、同価格帯のモデルの中で最もコストパフォーマンスが高いです。

企業のAI支出の急速な増加は業界の一般的な現象となっています。『フォーブス』の5月の報道によれば、Uberは開発者によるAnthropic Claude Codeの使用量の急増により、2026年のAI予算が4月に全て使い果たされました。約5000人のエンジニアで構成される組織において、Claude Codeの急速な普及によりAI支出が予想を大幅に超え、Uberはその後、各従業員に毎月¥238,100(US$1,500)の代理プログラミングツール使用上限を設定しました。Amazonも同様の困難に直面しており、内部のAIプロジェクトではAnthropic Claude Sonnetを利用して商品リストと著者情報の照合を行っており、プロジェクトコストは元の予算を860%超え、約180万ドルに達しました。

さらに大きな問題は、トークン使用によるコストの増加が5ヶ月間も適時に発見されなかったことです。

AIモデルが企業内部で急速に普及している中、特に代理機能や推論タスクへの移行が進む中で、AIトークンコストは急激に上昇しています。モデル開発者はトークン単価を下げたり、「プロンプトキャッシュ」技術を導入したりして対応していますが、キャッシュヒット後も料金が発生し、コンテキストが長くなるほど累積コストが高くなります。キャッシュが無効になる(例えば、対話間隔が5分を超えたり、履歴メッセージが変更されたりする)と、費用は元の価格で再計算されます。AAの知能指数は複合指標であり、複数の評価の加重結果を総合しています。タスクコストは、各モデルが複数の評価で実際に消費したトークン量(入力、キャッシュヒット、キャッシュ書き込み、推論、出力を含む)にトークン単価を掛けて算出されます。

なお、この指標はコーディング、数学、科学、代理タスクを基準としており、純粋な翻訳、チャットボット、一般的なオフィスシーンには適用されません。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle