AMD、AIチップスタートアップTaalasを買収し推論性能を強化

AMDは先週の木曜日の取引終了後、AIチップのスタートアップ企業Taalasを買収することを発表し、AI推論分野での競争力を強化することを目指しています。Taalasのコア技術は、モデルの重みを従来の高帯域幅メモリストレージに依存せず、直接シリコンチップにエッチングすることです。このアプローチにより、推論性能が1桁以上向上することが期待されています。Taalasは2023年に設立され、トロントに本社を置いており、その技術路線は従来のGPUやGroq LPU、Cerebrasのウェハーレベルアクセラレーターなどのデータフローアーキテクチャとは大きく異なります。同社のチップはHBMに依存せず、モデルの重みを直接シリコンチップにエッチングし、いわゆるモデル専用集積回路を形成します。

チップは主に2つの領域で構成されています。一つはモデルの重みを保存するマスクROMリサイクル構造、もう一つはKVキャッシュと微調整アダプタを格納するSRAMリサイクル構造です。

Taalas技術はAI推論性能を大幅に向上させる

今年2月、Taalasは初のテストチップHC1を発表しました。このチップはTSMCの6nmプロセスで製造されています。初期のベンチマークテストでは、このチップがMetaのLlama 3.1 8Bモデルを実行する際の速度が毎秒16960トークンに達し、この成績は当時のNVIDIA GPUの48倍、Cerebrasアクセラレーターの8.5倍でした。Llama 3.1は現在の基準では最新のモデルとは言えませんが、このマスクサイズのチップの主な目的は技術コンセプトの実現可能性を検証することです。

Taalasは今年の夏に第2世代HC2チップを発売する計画で、単一チップでサポートするパラメータの数を200億に引き上げることを目指しています。この数字は大きく聞こえないかもしれませんが、GPUと同様のパイプライン並列方式を用いることで、重みを複数のアクセラレーターに分散して実行することができます。

単一チップで200億パラメータを計算すると、わずか50個のアクセラレーターで万億パラメータ級の大規模モデルをサポートできます。一方、AMDはラックレベルの計算プラットフォームと内部システム設計チームを持っており、この需要に応えることができます。対照的に、NVIDIAが最近発表したLPXシステムは同等規模のモデルを運用するために数十個のGPUと少なくとも2000個のGroq LPUを必要とし、Taalasのソリューションはスペースの占有と電力効率の面で明らかな利点を持っています。関係者によると、AMDはTaalas技術に基づくチップをInstinctシリーズのHeliosラックと組み合わせて使用し、計算集約型のプロンプト処理をGPUが担当し、トークン生成タスクをTaalasアクセラレーターにオフロードするという分離型アーキテクチャを形成する計画です。

AMDのTaalas買収がAIハードウェア市場の構図を変える

もう一つの可能な展開モデルは、顧客が最初にInstinctアクセラレーター上でモデルを展開し、検証した後にTaalasアクセラレーターに移行するという、tick-tockのような反復リズムを形成することです。AMDのAI担当上級副社長Vamsi Boppanaは声明の中で、AMDは全スタックのAIプラットフォームを構築しており、顧客に柔軟性を提供し、各AIワークロードに最適な計算ソリューションを展開できるようにしていると述べました。しかし、この技術には明らかな制限もあります。モデルの重みがシリコンチップに固定されるため、チップの展開が完了するとモデルを変更することができず、LoRAアダプタのスケールを超える変更は再度のウェハ製造が必要であり、コストが高く、サイクルも長くなります。

AIモデルがほぼ毎月新バージョンをリリースしている現在、Taalas技術を採用する顧客はモデル選択に十分な理解が必要です。Taalas側は、新しいモデルが確かに再度のウェハ製造を必要とするが、最初からやり直す必要はなく、2層の金属層を変更するだけで済むため、コストとサイクルが大幅に削減されると述べています。アプリケーションシーンとしては、この技術は主にAIモデル開発者、インフラ提供者、そして一部の推論サービスプロバイダーを対象としています。Taalasは以前、モデルの重みをシリコンチップにエッチングするコストが最先端モデルのトレーニングコストの100分の1であると述べていました。

AMDは現在、OpenAI、Anthropic、Metaなどの主要モデルメーカーと密接な協力関係を維持しており、今後、GPTやClaudeシリーズのモデルがTaalasとInstinctのハイブリッドアーキテクチャに展開されるのは驚くべきことではありません。

さらに、この技術はモデル開発の方法にも深遠な影響を与える可能性があります。開発者は近年、テスト時のスケーリング技術を通じてモデルの幻覚を減少させるために、モデルが回答する前により長い時間推論を行うことを許可していますが、その代償としてより多くのトークンを消費し、コストが上昇し、ユーザーの待機時間が延びています。もしTaalas技術が単一トークンのコストを大幅に削減し、出力速度を10倍または20倍に向上させることができれば、モデル開発者はより高い精度を得るために推論時間をさらに延長する可能性があります。この取引は第4四半期に完了する見込みで、規制当局の承認を待っています。

AMDは具体的な取引条件を明らかにしていませんが、これは単なる人材の取得ではなく、完全な買収であるとされています。

この取引は、AMDがAIハードウェア分野でのNVIDIAの支配的地位に挑戦する最新の取り組みと見なされており、NVIDIAが昨年12月にGroqと結んだ200億ドルのライセンス契約と対を成すもので、高性能推論サービスをAIインテリジェンスなどのアプリケーションシーンでより速く、より安価に運用することを目指しています。

項目規格
製造プロセス6ナノメートル
単一チップパラメータ数200億

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle