智譜は9月18日に大モデルGLM-5.3-FlashXを正式に発表しました。このモデルの最高推論速度は200 tokens/sに達し、企業や開発者により速く、よりスムーズなモデル体験を提供することを目的としています。現在、GLM-5.3-FlashXのAPIはすでに稼働しています。紹介によれば、急速に増加するユーザーの需要に応えるため、智譜は従来の国産チップの計算能力を基に、Infra分野への投資と推論の最適化をさらに強化しました。GLM-5.3-Flashは同サイズで最強の知能レベルを維持し、非常に高いコストパフォーマンスを備えており、今回の速度向上は知能、価格、速度の全体的な競争力をさらに強化しました。
情報によると、智譜が以前に発表したGLM-5.3-Flashは正式リリース前に匿名モデル「Ox Alpha」として世界中の開発者に対して大規模テストを行い、広く認知されました。オンライン後の呼び出し量は持続的に増加し、OpenRouterプラットフォームの使用量ランキングで1位を獲得し、OpenCodeとOpenRouterの両プラットフォームで新たな呼び出し量の高記録を樹立しました。智譜は、GLM-5.3-Flashのすべてのオンライン呼び出しリクエストの処理に10万個の国産チップを投入したと述べています。
具体的なチップメーカーは公表されていませんが、業界アナリストはその大多数が華為技術の昇騰シリーズチップを採用していると推測しています。
智譜 GLM-5.3-FlashXは高効率の推論能力を備えています
集群レベルでは、智譜は生産レベルのEPD分離型アーキテクチャを採用し、多モーダルエンコーディング、プロンプトの事前充填、トークンごとのデコードを独立したスケジューリング、独立した拡張・縮小可能な作業プールに分割しました。エンドツーエンドのサービス性能は初期ベースラインに対して3倍向上し、ハードウェア効率と単一トークンコストは主流のNVIDIA GPUと同等のレベルに達しました。智譜側は、今回の最適化が国産チップが大規模なシーンで効率的かつ経済的に最前線のモデルの推論需要を支えることを検証したと述べています。

