AIデータインフラ企業Wekaは、高性能計算プラットフォームAndromedaと戦略的提携を結んだことを発表しました。WekaのNeuralMeshプラットフォームは、Andromedaの管理型GPUクラスターのコアAIデータストレージ層として機能します。専用のNeuralMeshまたはGPUネイティブ方式のNeuralMesh Axonを展開することで、Andromedaの顧客は異なる超大規模計算サービスプロバイダーやAIクラウド環境において一貫したストレージ性能を得ることができます。
Andromedaは、最先端技術を開発するすべてのチームが高性能計算リソースを利用できるようにし、革新がアイデアそのものによって推進されることを目指しています。同社は主要なAI研究機関、データセンター、クラウドサービスプロバイダーと提携し、グローバルなサプライチェーン内でトレーニングと推論のワークロードを分配しています。現在、Andromedaは世界中の50以上の計算プロバイダーと提携し、成長を続ける管理型クラスターネットワークを通じてトレーニングと推論のワークロードをルーティングしています。
AndromedaとWekaの提携がAIデータストレージ性能を向上させる
Andromedaプラットフォーム上のすべてのクラスターは、どのオペレーターが管理していても同じ品質基準を満たさなければなりません。会社は顧客にサービスを提供する前に、各クラスターのGPU、ストレージ、ネットワークアーキテクチャ、セキュリティを認証します。この過程で、異なる供給者のストレージ環境の違いがクラスター間の性能のばらつきの問題を徐々に浮き彫りにしています。
Wekaとの提携により、Andromedaは既存のハードウェア上で顕著な性能向上を実現し、数分で展開を完了し、すべての供給者の一貫性を確保しながらストレージコストを削減しています。AndromedaのCEOであるウィル・ムシェは、同社の目標は計算のグローバルな流動性を実現することであり、提供される各クラスターはその容量がどこから来ても正常に機能しなければならないと述べています。Weka NeuralMeshによる標準化を実現することで、顧客は性能を決定するストレージとメモリ層を選択する際に、超大規模サービスプロバイダーのレベルの一貫性とオープン市場の柔軟性を同時に得ることができます。
彼は、余剰のGPUがAI革新の速度を妨げていると付け加え、WekaはAndromedaが管理するすべてのGPUを最大限に活用する手助けをしています。NeuralMesh Axonは、NeuralMeshソフトウェアプラットフォームのGPUネイティブ展開方式であり、ストレージをAndromedaのGPUサーバーに直接統合し、クラスターの既存のNVMeを統一された高性能データ層に変換することで、トレーニングと推論に最高速度でデータを提供します。
このインフラはラックに設置され、電源が供給されているため、追加のスペース、電力消費、コストを増やすことなく性能を向上させることができます。NeuralMesh Kubernetes Operatorを活用することで、Andromedaは数分で完全なNeuralMeshクラスターを構築し、管理スタックの他のすべての層を同じワークフローで管理することができます。
AndromedaのNeuralMesh展開の約半分はNeuralMesh Axon方式で運用されており、残りの半分はすべてのGPUコアと1GBのメモリを自身のワークロードに専用する必要がある顧客に対して専用のNeuralMesh展開を提供しています。展開場所に関わらず、NeuralMeshは基盤となる任意の供給者のハードウェアに対して同じ性能基準を提供します。この信頼性により、Andromedaは顧客をこれまで共有ストレージのないクラスターに接続することが可能になりました。
提携による実際の効果はすでに現れています。新しいNeuralMesh Axonクラスターは、最短10分で展開が完了し、AIチームはクラスターがオンラインになったその日からワークロードを実行できます。環境の起動時間は3分から30秒に短縮され、AIチームは毎日より多くの実験を行うことができるようになりました。NeuralMesh Axonを運用するAndromedaクラスターは、クラスターごとに毎秒400GBを超える持続的スループットと、実際の運用環境で毎秒600万IOPSを超える性能を実現しています。
これにより、Andromedaのバイオテクノロジーの顧客は、10億ファイルのメタデータ集約型転送タスクを数時間ではなく数分で完了できるようになりました。クラスターに障害拡散のリスクがある場合、NeuralMeshは障害の伝播を阻止し、クラスターの可用性を維持し、すべての顧客のワークロードを保護します。
項目 規格 持続吞吐量 クラスターごとに毎秒400GB以上 IOPS 毎秒600万以上

