AMD、AIチップスタートアップTaalasを買収し推論性能を強化

AMDは先週木曜日の取引終了後、AIチップのスタートアップ企業Taalasを買収することを発表し、AI推論分野での競争力を強化します。Taalasのコア技術は、モデルの重みを従来の高帯域幅メモリストレージに依存せず、直接シリコンチップにエッチングすることです。このアプローチにより、推論性能が1桁以上向上することが期待されています。Taalasは2023年に設立され、トロントに本社を置いており、その技術路線は従来のGPUやGroq LPU、Cerebrasのウェハー級アクセラレーターなどのデータフローアーキテクチャとは全く異なります。同社のチップは、モデルの重みをHBMに依存せず、直接シリコンチップにエッチングして、いわゆるモデル専用集積回路を形成します。

チップは主に2つの領域で構成されています:1つはモデルの重みを保存するマスクROMリカバリ構造、もう1つはKVキャッシュと微調整アダプタを格納するSRAMリカバリ構造です。

Taalas技術はAI推論性能を大幅に向上させる

今年2月、Taalasは初のテストチップHC1を発表しました。このチップはTSMCの6nmプロセスで製造されています。初期のベンチマークテストでは、このチップがMetaのLlama 3.1 8Bモデルを実行する際に、毎秒16960トークンの速度を達成し、この成績は当時のNVIDIA GPUの48倍、Cerebrasアクセラレーターの8.5倍でした。Llama 3.1は現在の基準では最新のモデルとは言えませんが、このフォトマスクサイズのチップの主な目的は技術概念の実現可能性を検証することです。

Taalasは、今年の夏に第二世代HC2チップを発表する予定で、単一チップがサポートするパラメータの量を200億に引き上げることを目指しています。この数字は大きくは聞こえませんが、GPUと同様のパイプライン並列方式を使用することで、重みを複数のアクセラレーターに分散して実行できます。

単一チップ200億パラメータで計算すると、わずか50個のアクセラレーターで万億パラメータ級の大モデルをサポートできますが、AMDはちょうどそのニーズを満たすためのラックスケールの計算プラットフォームと内部システム設計チームを持っています。それに対して、NVIDIAが最近発表したLPXシステムは、同等の規模のモデルを運用するために数十個のGPUと少なくとも2000個のGroq LPUを必要とし、Taalasのソリューションはスペースの占有と電力効率の面で明らかな利点を持っています。関係者によると、AMDはTaalas技術に基づくチップをInstinctシリーズのHeliosラックと組み合わせて使用し、計算集約型のプロンプト処理をGPUが担当し、トークン生成タスクをTaalasアクセラレーターにオフロードする分離型アーキテクチャを形成する計画です。

AMDのTaalas買収はAIハードウェア市場の構図を変える

もう一つの可能な展開モデルは、顧客が最初にInstinctアクセラレーター上でモデルを展開し、検証を行った後、満足できる結果が得られた場合にTaalasアクセラレーターに移行するという、いわばtick-tockのような反復リズムを形成することです。AMDの人工知能上級副社長Vamsi Boppanaは声明の中で、AMDは全スタックのAIプラットフォームを構築しており、顧客に柔軟性を提供し、各AIワークロードに最適な計算ソリューションを展開できるようにしていると述べました。しかし、この技術には明らかな制限もあります。モデルの重みがシリコンチップに固定されるため、一度チップが展開されるとモデルを変更することはできず、LoRAアダプタのスケールを超える変更は再度のウェハー製造が必要であり、コストが高く、サイクルも長くなります。

AIモデルがほぼ毎月新しいバージョンをリリースしている現在、Taalas技術を採用する顧客はモデル選択に十分な理解を持つ必要があります。Taalas側は、新しいモデルが確かに再度のウェハー製造を必要とするが、ゼロから始める必要はなく、2層の金属層を変更するだけで済むため、コストとサイクルが大幅に削減されると述べています。アプリケーションシーンとしては、この技術は主にAIモデル開発者、インフラ提供者、および一部の推論サービスプロバイダーを対象としています。Taalasは以前、モデルの重みをシリコンチップにエッチングするコストが最先端モデルのトレーニングコストの100分の1であると述べていました。

AMDは現在、OpenAI、Anthropic、Metaなどの主要なモデルメーカーと密接な協力関係を維持しており、今後GPTやClaudeシリーズのモデルがTaalasとInstinctのハイブリッドアーキテクチャに展開されることは驚くべきことではありません。

さらに、この技術はモデル開発方法にも深遠な影響を与える可能性があります。開発者は近年、テスト時のスケーリング技術を使用してモデルの幻覚を低減しており、これはモデルが回答する前により長い時間推論を行うことを許可しますが、その代償としてより多くのトークンを消費し、コストが上昇し、ユーザーの待機時間が延びます。もしTaalas技術が単一トークンのコストを大幅に削減し、出力速度を10倍または20倍に向上させることができれば、モデル開発者はさらなる高精度を得るために推論時間を延長する可能性があります。この取引は第4四半期に完了する予定で、規制当局の承認を待っています。

AMDは具体的な取引条件を明らかにしていませんが、これは単なる人材買収ではなく、完全な買収であるとされています。

この取引は、AMDがAIハードウェア分野でNVIDIAの支配的地位に挑戦する最新の試みと見なされており、NVIDIAが昨年12月にGroqと結んだ200億ドルのライセンス契約と対比され、いずれも高性能推論サービスをAIエージェントなどのアプリケーションシーンでより迅速かつ安価に実行することを目指しています。

項目 規格
製造プロセス 6nm
単一チップのパラメータ数 200億
Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle