MetaとPanmnesiaが新しいアーキテクチャを提案、AIデータセンターを一つの巨大コンピュータのように機能させる

人工知能データセンターの設計が変わろうとしており、今後は単なる独立したマシンの集合体ではなく、巨大なコンピュータのようになる可能性があります。これは半導体会社PanmnesiaとMetaが提案した新しいアーキテクチャ設計の理念です。この設計は、計算拡張リンク(CXL)を利用して、ラック間で中央処理装置(CPU)、人工知能アクセラレーター、メモリを接続し、それらの動作を高度に調整された状態に保つことを目的としています。人工知能モデルの成長に伴い、この問題はますます深刻になっています。数兆のパラメータを持つモデルのトレーニングには、数百または数千のアクセラレーターが必要であり、数TBのデータを交換する必要があります。

ほとんどのデバイスが迅速にタスクを完了できるとしても、いずれかのコンポーネントの速度が遅いと、全体の操作が遅延する可能性があるため、遅延の予測可能性がますます重要になっています。

ラック内では、アクセラレーターが専用の高速接続を介して通信できるようになっています。しかし、ラック間では、データは通常、従来のネットワーク機器やソフトウェア層を通じて転送され、これが個別のリクエストにかかる時間の変動を引き起こします。PanmnesiaとMetaのアプローチは、CXLドメインを個別のラックの外に拡張し、より広範なデータセンターに入ります。このアーキテクチャは、各ラックを独立した計算アイランドとして扱うのではなく、施設全体のリソースが協調して動作することを目指しています。設計には、3つのハードウェアコンポーネントが重要です:高ファン非ブロッキングCXLスイッチ、リンクアクセラレーションユニット、ファブリックコントローラーです。

これら3つの組み合わせは、デバイス間でデータを転送する際の不確実な遅延を減少させることを目的としています。

新しいアーキテクチャが人工知能データセンターの性能を向上させる

このアーキテクチャは、光接続を利用して電気信号の物理的距離の制限を克服し、CXL-over-opticsによりファブリックをデータセンターのより広い部分に拡張できるようにします。これにより、基盤となるCXLモデルを放棄することなく、システムの計算リソースの協調作業のスケールが変わります。参照構成では、1つのCPUが2つのアクセラレーターに接続されていますが、新しいアーキテクチャでは、この数字が16に増加し、単一の一貫性ドメインが最大960のアクセラレーターをカバーできるようになります。

遅延が新たな戦場となります。研究者たちは、通常はラックを離れ、従来のネットワークを介してアクセスする必要があるものが、より予測可能な経路に沿って行われる可能性があると述べています。往復遅延はマイクロ秒の範囲から数百ナノ秒に減少する可能性があり、これは最大で10倍の減少を意味します。この予測可能性は、元の計算能力と同じくらい重要かもしれません。大規模な人工知能ワークロードは通常、集団での操作であり、最も遅い参加者が全体の操作がいつ行われるかを決定する可能性があります。これらの遅延を減少させることで、より多くのアクセラレーターが1つの実行環境として機能できるようになります。このアーキテクチャは、故障の影響を軽減する可能性もあります。

問題が発生した場合、提案されたシステムは、全体のサーバーではなく、個々のデバイスを置き換えることになります。

PanmnesiaのCEO、Myoungsoo Jung氏は次のように述べています。「人工知能システムが継続的に拡張するにつれて、大量のアクセラレーターとメモリデバイスを迅速かつ効率的に接続する能力は、単一のアクセラレーターの性能と同じくらい重要になっています。本研究は、次世代の人工知能インフラストラクチャの方向性を描いており、CXLはデータセンター全体が単一の計算システムとして機能できるようにします。」Panmnesiaは、コアコンポーネントをシリコンチップに実装し、検証を完了し、商業供給の準備を進めていると述べています。

この研究の成果は『Nature Reviews: Electrical Engineering』に発表されました。

項目規格
CPU接続のアクセラレーター数16
カバー可能なアクセラレーター数960

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle