全く新しいロボット基盤モデルは、わずか3秒から12秒の単一デモから物理タスクを学習し、その後、グラデーション更新や微調整なしでそのタスクを試みることができます。このモデルはGEN-1.5と呼ばれ、Generalist AIによって開発され、エンジニアが新しいタスクごとにモデルを再訓練することなく、物理的な例から直接学習することを目的としています。同社によれば、このモデルは短い感覚的な動作デモから実行すべきタスクを推測し、即座にそのタスクを試みることができるとのことです。10の物理タスクに対するテストでは、GEN-1.5は1つのデモのみを提供された場合、平均成功率が59%に達しました。
5分間のタスク専用データと10回のグラデーションステップを提供した場合、平均成功率は83%に向上しました。これらのタスクは意図的に簡単で短時間で完了できるように設計されており、内容にはガラス瓶の蓋を開けること、財布からお金を取り出すこと、カップを積み重ねること、ゴミを掃除すること、本をめくること、ペンケースのファスナーを引くこと、掃除機のパッドを取り外すことが含まれています。
GEN-1.5モデルは強力な学習能力を示す
GEN-1.5は大規模なマルチモーダルモデルで、ビデオ、センサーデータ、言語データ、および本体認識データを処理できます。コンテキスト内で30秒間の情報を保持し、100Hzの頻度で動作軌跡を生成することができます。デモ自体はGeneralist AIが「物理的なヒント」と呼ぶものとして機能します。これらのヒントは、ハンドヘルドデバイスを使用する人から、ロボットがタスクを実行する際に生成されるものまで、さまざまです。一度デモがモデルのコンテキストウィンドウに入ると、ロボットはトレーニングフェーズなしでそのタスクを実行しようとします。
同社は、GEN-1.5がコンテキスト学習のために特別に訓練されておらず、アーキテクチャの変更、メタラーニングサイクル、またはモデルの即興的なパフォーマンスを促進するための追加の目標が追加されていないと述べています。これにより、報告された結果は従来のロボット訓練方法とは異なり、新しいタスクには通常、大量の専用データと繰り返しの最適化が必要です。
GEN-1.5は物理的なヒントを組み合わせることもできます。あるデモでは、モデルはペンケースのファスナーを引くデモと財布からお金を取り出すデモをそれぞれ受け取り、その後、これら2つの行動を連続したシーケンスとして接続し、どちらのデモにも現れなかった中間の再配置と回収動作を生成しました。このモデルは、見た動作を超える一般化能力も示しています。シミュレーション環境で録画されたデモは、実際のロボットにヒントを与えるために使用でき、モデルの事前訓練にはシミュレーションデータが含まれていませんでした。生成された行動は、異なる手の位置や物体のサイズの変化に適応することができます。
別のテストでは、ある人物がロボットのカメラの視界内で自分の手でタスクをデモし、その後ロボットが自分の手でその動作を再現しました。
GEN-1.5の適応性と革新能力
Generalist AIは、モデルがわずかにグラデーションステップを微調整した後の反応もテストしました。GEN-1.5は、新しいタスクに1から10ステップで適応でき、1から5分のデータを使用します。これは約10から50回のデモに相当します。このモデルは、時には示された内容を超えることさえあります。ブラシを使ってブロックをボウルに掃き入れることを学んだ後、目の前にバナナが現れると、それを即興のブラシとして使用しました。ほうきを与えられたときには、そのツールを使ってブロックを持ち上げてボウルに倒すための異なる戦略を展開しました。
同社は、これらの行動が新しいロボットプログラミングのアプローチを示唆していると述べています。ユーザーはもはや新しいタスクごとに詳細な指示を書く必要がなく、最終的に必要な内容をデモすることで、ロボットが物理的な詳細を自ら処理できるようになります。

