ロボットが模倣学習で多様な実用スキルを習得

あるロボットがボウリング、タオルの折りたたみ、キャップの取り外し、飲料の注ぎ、そして新鮮なオレンジジュースの作成を学びました。これはまず人間のデモを模倣し、その後自主的な学習を通じてスキルを向上させることで実現されました。研究者たちは、模倣学習と強化学習を組み合わせた新しいトレーニングフレームワーク「RL-100」を開発しました。このフレームワークにより、ロボットは高い信頼性でさまざまな現実世界の操作タスクを実行できるようになりました。テストでは、システムは不慣れな状況に適応し、干渉から回復し、さらには複数のタスクで人間の遠隔オペレーターと同等またはそれを超えるパフォーマンスを示しました。このロボットは公共のショッピングモールで7時間連続して稼働し、顧客に新鮮なジュースを提供し、一度も故障することはありませんでした。

RL-100 トレーニングフレームワークがロボットの学習能力を向上させる

スマートロボットの学習は、上海交通大学の研究チームによって主導されており、このフレームワーク「RL-100」は、ロボットがまずデモから安全な人間の行動を学び、その後自主的な反復実験を通じてこれらのスキルを改善することを可能にします。このアプローチは、ロボット技術の大きな課題を克服します。それは、人間を単に模倣するだけでなく、より速く、より信頼性が高く、非構造化環境でより適応的なパフォーマンスを実現することです。研究者たちは、子供の学習プロセスからインスパイアを受けており、赤ちゃんは最初は親の指導に依存し、その後独立した練習を通じて自分の能力を向上させます。RL-100は同じ理念に従い、3つの段階の学習プロセスを通じて実現されます。

第一段階では模倣学習を使用し、ロボットは人間の専門家による遠隔操作のデモを観察します。これらのデモは、ロボットが視覚入力(RGBカメラや3Dポイントクラウドキャプチャを通じて)と対応する操作行動との関係を学ぶための拡散に基づく視運動戦略を訓練します。この段階は安定した行動の基盤を提供しますが、依然として人間のデモの質と効率に制約されます。この「模倣の天井」を克服するために、第二段階では反復的なオフライン強化学習が導入されます。ロボットはもはや人間のデータに依存せず、タスクを繰り返し実行し、結果の経験を保存し、デモデータと自身の成功した試行を利用して再訓練を行います。

近似最適化(PPO)に基づく統一された目標により、システムは以前の学習した行動を損なうことなく拡散戦略を洗練することができ、オフライン戦略評価メカニズムはパフォーマンスを低下させる可能性のある更新を防ぎます。最後の段階では、物理ロボット上で少量のオンライン強化学習を直接適用します。この段階は特に、オフライントレーニング後に残る稀な失敗ケースに焦点を当て、信頼性を約90%の成功率からほぼ完璧なタスク完了率に引き上げる一方で、比較的少ない追加の実データを必要とします。

RL-100 の現実世界での成功した応用

RL-100は、拡散戦略の重要な実用的制限である計算遅延にも対処しています。標準の拡散モデルは各アクションを実行する前に複数の去ノイズステップを必要とし、これにより高頻度のロボット制御においては遅すぎます。この問題を解決するために、研究者たちは一貫性モデル蒸留技術を開発し、多段階の拡散戦略を単一のコントローラーに圧縮し、推論遅延を約100ミリ秒から約10ミリ秒に削減し、パフォーマンスを維持しました。これにより、デプロイメントプロセス中の反応時間が速くなり、制御がよりスムーズになります。

このフレームワークは、タスク、ロボット、表現に依存せず、単腕および双腕ロボット、単一アクションおよびアクションブロック制御、RGB画像または3Dポイントクラウドをサポートし、基盤となる学習フレームワークを変更する必要がありません。研究者たちは、剛体物体、可変形材料、液体、精密組立を含む8つの挑戦的な操作タスクでRL-100を評価しました。これらのタスクには、ボウリング、タオルの折りたたみ、飲料の注ぎ、キャップの取り外し、ボックスの折りたたみ、オレンジジュース作成の2つの段階が含まれます。全トレーニングプロセスを完了した後、ロボットは1,000回の評価試験で100%の成功率を達成し、タスク完了速度では専門家の人間の遠隔オペレーターと同等またはそれを超え、未見の物体や環境の変化に適応し、再訓練なしで、研究者がその行動に物理的な干渉を加えた場合でも安定性を保ちました。

現実世界でのデプロイメントでは、このロボットがショッピングモール内で顧客に新鮮なオレンジジュースを7時間連続して提供し、一度も故障することがなかったことが証明され、このフレームワークが家庭、工場、公共の場で信頼性のある長期運用の可能性を持つことを示しています。

項目規格
計算遅延約 10 ミリ秒
成功率100%

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle