Apple、蛋白質設計向けの新AIモデル「SimpleDesign」を発表

Appleの研究者たちは、新しい研究で、共同でタンパク質の配列と構造を生成できるシンプルな人工知能モデル「SimpleDesign」を詳しく紹介しました。この研究の背景には、昨年9月にAppleの研究者たちが発表した「SimpleFold:タンパク質の折りたたみはあなたが思っているよりも簡単」という研究があります。この研究では、アミノ酸配列からタンパク質の三次元構造を予測するための簡素化された方法が詳述されています。簡単に言えば、SimpleFoldはフローマッチングモデルを使用して、アミノ酸配列から直接タンパク質の三次元構造を生成します。

ここではフローマッチングについて詳しく説明しますが、簡単に言うと、この技術は騒がしいランダムな基盤から始まり、最終結果に到達するための比較的直接的な経路を学習します。これは、最終出力に到達するために通常、繰り返しノイズを除去する拡散モデルとは対照的です。これら2つの技術は、歴史的に見ても画像生成に関連していることが最も多いですが、研究者たち(Appleの研究者を含む)は、テキストやコード生成における拡散モデルの応用も探求しています。

SimpleDesignモデルの革新的な設計がタンパク質生成の効率を向上させる

SimpleFoldに戻ると、Appleは基本的にフローマッチングを一般的なトランスフォーマーモジュール(通常はテキスト生成に使用される)と組み合わせて、モデルがDeepMindの有名なAlphaFoldのような従来のタンパク質折りたたみモデルに必要な計算コストの高い技術を回避できるようにしました。現在、Appleの研究者たちはSimpleDesignを発表し、SimpleFoldで探求された簡素化された一般的なアーキテクチャを、タンパク質の三次元構造の予測だけでなく、より広範なタンパク質設計の問題に適用することを目指しています。

Appleの研究者たちが新しい研究「SimpleDesign:タンパク質の配列と構造を共同設計するモデル」で述べているように、既存のモデルは通常、多段階のトレーニングプロセスに依存しています。ここでは、自己符号化器がデータを潜在表現にマークし、第一段階でトレーニングが行われます。次に、生成モデルが自己符号化器の潜在表現上でトレーニングされ、潜在空間で生成モデリングが行われます。私たちは、この多段階トレーニングが高性能な共同設計モデルを得るために必須ではないと仮定し、データ空間で直接トレーニングされる効果的なマルチモーダルタンパク質設計モデルであるSimpleDesignを提案しました。

言い換えれば、多くの既存のタンパク質設計モデルが多段階プロセスに依存しているのに対し、SimpleDesignは単一のエンドツーエンドのトレーニングプロセスでアミノ酸配列と連続した三次元構造を生成することを学びます。

タンパク質設計分野におけるSimpleDesignの可能性と課題

現在の多くのタンパク質共同設計モデルの動作方法は次のとおりです。まず、タンパク質構造を離散表現または「マーク」に変換するための個別のモデルをトレーニングします。次に、これらの表現を処理して新しいタンパク質配列と構造を生成するための生成モデルをトレーニングします。SimpleDesignはこの中間ステップをスキップし、ペアになったアミノ酸配列と三次元座標から直接学習します。つまり、タンパク質構造を個別のマーク化表現に圧縮することなく学習します。Appleの研究者たちがSimpleDesignをトレーニングした方法は非常に興味深いです。

彼らは、AlphaFoldデータベースからの予測構造と他のサンプルを組み合わせたAFESMデータセットから200万以上のタンパク質配列と構造のペアを使用してトレーニングを行いました。

トレーニング中、彼らは各ペアの2つの部分に損傷を加えました。アミノ酸配列のアミノ酸がランダムに隠され、対応する三次元構造にもノイズが追加されました。研究者たちは、各側の擾乱の程度を変更することも行いました。もし配列がほぼ完全で構造が深刻に損なわれている場合、このタスクはタンパク質の折りたたみに似ており、モデルは既知の配列から構造を復元しなければなりません。逆に、構造がほぼ完全で配列が深刻に隠されている場合、これは逆折りたたみに似ています。モデルは、与えられた構造を生成できる配列を生成しなければなりません。そして、両方が部分的に擾乱されている場合、モデルはこの2つの問題を同時に解決することを学び、効果的にタンパク質共同設計のトレーニングを行います。

この研究によると、より簡素化されたトレーニングプロセスを使用しているにもかかわらず、SimpleDesignはタンパク質共同設計、構造生成、配列生成のベンチマークで競争力のある結果を提供しています。研究者たちはまた、SimpleDesignが合理的なタンパク質構造を生成でき、その生成されたアミノ酸配列は通常、ほとんどの競争的なマルチモーダルモデルが生成する配列と同じかそれ以上の品質であることを発見しました。最後に、研究者たちは、SimpleDesignの結果は計算に基づく評価に限られていると指摘しています。生成されたタンパク質は、実際の生物システムで折りたたまれ、機能し、安全に行動できるかどうかを確認するために実験的にテストされていません。

それにもかかわらず、これらの結果は非常に励みになるものであり、全体の研究(自然にSimpleDesignのアーキテクチャ、トレーニングプロセス、ベンチマーク、結果をより深く探求することになるでしょう)は読む価値があります。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle