研究チームが開発したBeyondMimicフレームワーク、ヒューマノイドロボットが個別の訓練なしで高難度の動作を実現

研究者たちは最近、BeyondMimicという新しいフレームワークを発表しました。このフレームワークは、人型ロボットが敏捷で人間に近い動作を実行し、複数のスキル間をスムーズに切り替えることを可能にします。このシステムにより、ロボットは側転、回し蹴り、さまざまな運動動作やアクロバットパフォーマンスなどの複雑な動作を、各タスクごとに独立したトレーニングを行うことなく実行できるようになります。BeyondMimicは人間の動作データから学習し、習得した動作を新しいタスクや新しい環境に移行することができます。研究チームは、この方法が現在の人型ロボット制御システムの制限を解決する可能性があると述べています。既存のシステムは通常、大量の微調整を必要としたり、硬直した不自然な動作しか生成できなかったりします。

フレームワークは人間のデモデータから敏捷な動作を学習

BeyondMimicモデルは、人型ロボットが人間のデモから敏捷で人間に近い動作を学習し、これらのスキルを組み合わせて、明示的にトレーニングされていないタスクを実行できるようにします。このシステムは、人型ロボットの分野における重要な課題に取り組んでいます。ロボットは歩行、ジャンプ、蹴りなどの個別の動作を学習できますが、異なるスキル間を自然に切り替えることは依然として非常に困難です。既存の方法は通常、特定の動作に対して報酬関数を設計し、大量の調整を行うか、各タスクごとに別々にトレーニングを行う必要があります。BeyondMimicは、これらの制限を克服するために二段階の学習フレームワークを採用しています。

第一段階では、研究チームが強化学習(RL)を使用して、ロボットがさまざまな人間の動作を追跡するようにトレーニングしました。重要なのは、チームが単一の動作追跡式、共有報酬構造、共通のハイパーパラメータを使用し、各動作ごとにシステムを個別に調整する必要がなかったことです。

研究者たちは約2.5時間の多様な人間の動作データを使用してこのシステムをトレーニングし、一般的な歩行や走行、片足でのバランス、ジャンプ、ダンス動作、武道にインスパイアされた動作、回し蹴り、側転など、数百のスキルを学習させました。その後、研究チームは21の代表的な動作クリップを実体の人型ロボットに展開し、システムがシミュレーション環境で学んだことをハードウェアに信頼性高く移行できることを証明しました。第二段階では、潜在拡散モデル(latent diffusion model)が導入され、BeyondMimicに動作を生成し組み合わせる能力が与えられました。

このモデルは、単に学習した動作のシーケンスを再生するのではなく、状態と動作軌跡の基底分布を学習します。研究チームは、変分オートエンコーダ(variational autoencoder)がまずこれらの動作をより滑らかな潜在表現に圧縮し、その後、拡散モデルがこれらの表現の進化の仕方を学習すると述べています。

システムは推論段階でタスク目標を柔軟に調整可能

研究者たちはその後、推論段階で分類器ガイダンス技術を使用して、拡散モデルをトレーニング段階でカバーされていない目標に導き、ロボットが基底戦略を再トレーニングまたは微調整することなく既存のスキルを調整できるようにしました。たとえば、システムはジョイスティックの指示を受け取り、それに応じた歩行または走行動作を生成することができます。また、指定された目標地点に移動したり、障害物を避けたり、希薄な未来のキーフレームに基づいて完全な遷移動作を生成したりすることも可能です。デモの一つでは、ロボットは歩行からスムーズに側転に移行し、その後再び歩行状態に戻りました。また、側転と歩行、走行を交互に組み合わせた動作シーケンスも実行しました。

この方法は、目標を同時に組み合わせることも可能です。たとえば、目標地点の追跡と障害物回避コストを統合することで、ロボットは目標に向かって進みながら障害物を回避することができます。同じフレームワークは、ジョイスティック制御と衝突回避を組み合わせて使用することもできます。実体のロボットは、高度に動的な動作を示しました。空中側転、回し蹴り、翻転蹴りなどです。空中側転の過程で、ロボットのピーク加速度は31 m/s²に達し、骨盤の角速度は最大15.7 rad/sに達し、文献で報告されている熟練した人間の空中動作の数値に匹敵します。

敏捷性に加えて、研究者たちはシステムが生成した歩行および走行動作が人間の観察者にとってより自然であることを発見しました。77名の参加者を対象とした研究では、BeyondMimicが生成した動作が70.8%の選択肢でロボットのネイティブコントローラーよりも人間に近く、より自然であると評価されました。一方、ネイティブコントローラーはわずか29.2%の好ましさを得ました。研究チームは、核心的な突破口は単一の新しいコンポーネントではなく、スケーラブルな動作追跡、潜在拡散モデル、および推論段階のガイダンステクニックを統合したことにあると述べています。

スキルの獲得とタスク仕様を分離することで、BeyondMimicは人型ロボットに新たな道を開き、大量の人間の動作ライブラリを学習し、特定のタスクに対して再トレーニングすることなく、さまざまなスキルを再組み合わせて新しい状況に対応できるようにします。

項目規格/數據
フレーム名BeyondMimic
学習方法二段階(強化学習 + 潜在拡散モデル)
トレーニングデータの長さ約 2.5 時間の人間の動作データ
習得したスキルの数数百
実体ロボットにデプロイされた動作の数21 段
空中側転のピーク加速度31 m/s²
骨盤の最大角速度15.7 rad/s
ユーザー研究の参加者数77 人
BeyondMimic 動作の好みの割合70.8%
ネイティブコントローラー動作の好みの割合29.2%

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle