研究者たちは、新しい制御フレームワークを開発し、人型ロボットが柔軟な動作を実行できるようにしました。これには、這うこと、ブレイクダンス、そして宙返りが含まれます。このシステムは「ゼロショット具現化スキル転送(Zero-shot Embodied Skill Transfer、略称ZEST)」と呼ばれ、強化学習技術を利用して、ロボットが人間の動作キャプチャ、ビデオ、アニメーションデータから全身の動きを学習します。特定のタスクのトレーニングを必要とする従来の方法とは異なり、ZESTはロボットが展開前に単一のトレーニング段階を通じて複数の動作を学ぶことを可能にします。
Boston DynamicsのAtlas、UnitreeのG1、そしてBoston DynamicsのSpotのテストでは、これらのロボットが這うこと、側転、逆立ち、サッカーなどの複雑な動作を実行でき、さまざまなロボットの体型に適応できることが示されました。
ZESTシステムはロボットの動作の柔軟性を大幅に向上させる
RAI InstituteとBoston Dynamicsの研究者たちが開発したZESTは、脚型ロボットに対して、動作データから複雑な人間の動作を学ぶより柔軟な方法を提供するための強化学習フレームワークです。このシステムは、新しいロボットスキルに通常必要とされるエンジニアリングやコントローラーの調整を減少させることを目的としています。ZESTは、3つの異なるソースから学習できます:高忠実度の動作キャプチャデータ、単一のカメラで撮影された一般的なビデオ、そしてキーフレームアニメーションです。動作キャプチャやビデオからの人間の動作は、運動学的リダイレクションを通じてロボットに適した形式に変換され、アニメーションは人間が実行できない、または非人型ロボットにより適した動作を提供します。
重要なのは、このフレームワークがデモを必要とせず、ロボットがいつ、どこで地面と接触すべきかを識別するための明確なラベルを含む必要がないことです。
そのコア技術は、完全にシミュレーション環境で訓練された強化学習戦略であり、その後、追加の微調整なしに物理ハードウェアに移転されます。ZESTは比較的シンプルなフィードフォワード戦略を使用し、展開中はロボットの自己認識測定にのみ依存します。チームが発表した研究によれば、このシステムは、複雑なロボット制御パイプラインに通常使用されるいくつかのコンポーネントを回避しています。これには、状態推定器、長期観察履歴、未来の参照ウィンドウ、接触計画、そして広範なタスク特有の報酬エンジニアリングが含まれます。
ZESTの重要な特徴の一つは適応サンプリングです。ZESTは、各動作シーケンスのすべての部分で均等に訓練するのではなく、軌跡を固定長のセグメントに分割し、各セグメントでのロボットの失敗頻度を追跡します。より困難な部分はより頻繁にサンプリングされ、最低サンプリング確率はより簡単なスキルが忘れられるのを防ぎます。このシステムは、ロボットのベースに力を加える仮想モデルに基づく自動コースも使用します。困難な動的動作では、助力が最も強く、戦略の改善に伴い徐々に減少します。
ZESTの応用範囲と今後の研究方向
研究者たちは、関節(例えば、足首、膝、腰)における閉ループ平行リンクアクチュエーターの簡略化モデルも開発しました。これらの近似は、シミュレーションの複雑さを減少させつつ、重要なアクチュエーターの力学を保持します。ZESTは、電力制限、モーターの飽和、伝達損失、摩擦など、アクチュエーターの影響も取り入れ、シミュレーションと現実世界の移転を改善します。この方法は、Boston DynamicsのAtlas、UnitreeのG1、そしてBoston DynamicsのSpot四足ロボットでテストされています。
各独立した戦略には、約10時間の訓練、または約7,000回の反復が必要で、単一のNVIDIA L4 GPUで行われます。
Atlasでは、ZESTが這うこと、前転、側転、軍事這い、そしてブレイクダンスなどの動作を再現しました。ビデオから派生したスキルには、ダンス、サッカー、そして箱を登ることが含まれ、アニメーションはSpotが連続的な宙返りやバレルロールを実行できるようにしました。研究者たちは、ZESTが人間の運動データからロボット制御へのプロセスを簡素化できるが、現在は平坦で滑りにくい環境に限られており、完全に未見の動作に対する一般化能力は示されていないと述べています。今後の研究には、ゼロショットおよび少ショット適応、継続的学習、言語またはキーフレームに基づく制御、そして高度なコマンドを実行可能なロボット動作に変換する生成システムが含まれます。

