WekaとAndromedaが提携、AIデータストレージと性能向上を支援

AIデータインフラ企業Wekaと高性能計算プラットフォームAndromedaは、最近戦略的提携を発表しました。WekaのNeuralMeshプラットフォームは、Andromedaの管理型GPUクラスターのコアAIデータストレージ層として機能します。専用のNeuralMeshまたはGPUネイティブ方式のNeuralMesh Axonを展開することで、Andromedaの顧客は異なる超大規模計算サービスプロバイダーやAIクラウド環境において、一貫したストレージ性能を得ることができます。

Andromedaは、最先端技術を開発するすべてのチームが高性能計算リソースにアクセスできるようにすることに努めており、革新はアイデアそのものによって、ハードウェアの可用性によってではなく推進されるべきだと考えています。同社は主要なAI研究機関、データセンター、クラウドサービスプロバイダーと協力し、グローバルなサプライチェーン内でトレーニングと推論のワークロードを配分しています。現在、Andromedaは世界中の50社以上の計算プロバイダーと提携し、成長を続ける管理型クラスターネットワークを通じてトレーニングと推論のワークロードをルーティングしています。

AndromedaとWekaの提携がAIデータストレージ性能を向上させる

Andromedaプラットフォーム上のすべてのクラスターは、どの運営者が管理していても同じ品質基準を満たさなければなりません。会社は顧客にサービスを提供する前に、各クラスターのGPU、ストレージ、ネットワークアーキテクチャ、およびセキュリティを認証します。この過程で、異なるプロバイダーのストレージ環境の違いがクラスター間の性能のばらつきの問題を徐々に浮き彫りにしています。

Wekaとの提携を通じて、Andromedaは既存のハードウェア上で顕著な性能向上を実現し、数分以内に展開を完了し、すべてのプロバイダーの一貫性を確保しつつ、ストレージコストを削減しています。AndromedaのCEOであるウィル・ムシェは、同社の目標は計算のグローバルな流動性を実現することであり、提供されるすべてのクラスターはその容量がどこから来ても正常に機能しなければならないと述べています。Weka NeuralMeshによる標準化を実現することで、顧客は性能を決定するストレージとメモリ層を選択する際に、超大規模サービスプロバイダーのレベルの一貫性とオープン市場の柔軟性を同時に得ることができます。

彼は、未使用のGPUがAI革新の速度を妨げていると付け加え、WekaはAndromedaが管理するすべてのGPUが十分に活用されるように助けています。NeuralMesh Axonは、NeuralMeshソフトウェアプラットフォームのGPUネイティブな展開方式であり、ストレージをAndromedaのGPUサーバーに直接統合し、クラスターの既存のNVMeを統一された高性能データ層に変換することで、トレーニングと推論に最高速度でデータを提供します。

このインフラストラクチャはラックに設置され、電源が供給されているため、追加のスペース、電力消費、費用を増やすことなく性能を向上させることができます。NeuralMesh Kubernetes Operatorを活用することで、Andromedaは数分以内に完全なNeuralMeshクラスターを構築し、管理スタックの他のすべての層を同じワークフローで管理することができます。

AndromedaのNeuralMesh展開の約半分はNeuralMesh Axon方式で運営されており、残りの半分はすべてのGPUコアと各GBメモリを自身のワークロードに専用する必要がある顧客に専用のNeuralMesh展開を提供しています。展開場所に関係なく、NeuralMeshは基盤となる任意のプロバイダーのハードウェアに対して同じ性能基準を提供します。この信頼性により、Andromedaは顧客を以前は共有ストレージのないクラスターに接続することができます。

提携による実際の効果はすでに現れています。新しいNeuralMesh Axonクラスターは、最短10分で展開を完了し、AIチームはクラスターがオンラインになったその日からワークロードを実行できます。環境の起動ロード時間は3分から30秒に短縮され、AIチームは毎日より多くの実験を行うことができるようになりました。NeuralMesh Axonを運営するAndromedaクラスターは、クラスターごとに毎秒400GBを超える持続的スループットと、実際の運用環境で毎秒600万を超えるIOPSの性能を実現しています。

これにより、Andromedaのあるバイオテクノロジー顧客は、数時間ではなく数分で、各ディレクトリに10億ファイルを含むメタデータ集約型転送タスクを完了することができます。クラスターに故障拡散のリスクがある場合、NeuralMeshは故障の伝播を阻止し、クラスターの可用性を維持し、すべての顧客のワークロードを保護します。

項目 規格
持続スループット クラスターごとに毎秒400GBを超える
IOPS 毎秒600万を超える
Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle