Dyna Robotics、動画による人間のトレーニングを基にしたDYNA-2ロボットモデルを発表し、タスク成功率を90%に向上

Dyna Roboticsは最近、新型ロボット基礎モデルを発表しました。このモデルは、100万時間以上の人間のビデオを基にトレーニングされています。同社は、この規模がロボットに物理的なタスクを処理させる際の大きな課題を克服することが期待できると述べています。カリフォルニア州レッドウッドシティに本社を置く同社は、DYNA-2ワールドアクションモデルがロボットの行動データではなく、人間の自己中心的なビデオに基づいて完全にトレーニングされていると発表しました。このデータセットは、約170年分の継続的な覚醒経験に相当します。このアプローチは、ロボットが人間と物体およびその周囲の環境との相互作用から物理的なスキルを学ぶことを目的としており、手動で収集されたリモートデータへの依存を減らすことを目指しています。

Dynaは、これがロボットをトレーニングするためのよりスケーラブルな方法を提供し、能力の拡張に応じて調整できる可能性があると述べています。

DYNA-2モデルがロボットのタスク成功率を大幅に向上

テスト結果によると、同社はDYNA-2が高精度製造分野におけるタスク成功率を20%から80%-90%に引き上げたと報告しています。これは、事前トレーニングのスケールを増やすことによって実現されました。さらに、このモデルは静的なロボットアーム、人型プロトタイプ、巧妙なロボットハンド間での知識の転送を示しました。Dynaのモデルは、次のフレームと次の行動の予測を組み合わせた世界モデルアーキテクチャを使用しています。このシステムは、ロボットが実行する行動を学ぶだけでなく、人間のビデオを利用して物理環境の変化や物体の運動に対する反応を理解することを発展させます。

これにより、人間の行動から得られた知識が異なるロボットハードウェア間で転送可能になります。

Dynaは、DYNA-2が事前トレーニング中にロボットデータに接触していないが、わずか数時間のローカル微調整で異なるプラットフォームに適応できると述べています。あるテストでは、わずか13分のデータでDYNA-2が5本指のロボットハンドにボトルキャップを開けさせることができました。15のベンチマークタスクの中で、Dynaはより多くの人間のビデオでトレーニングされたモデルが常に優れたパフォーマンスを示したと述べています。同社はまた、DYNA-2とその初期のDYNA-1モデルを比較しました。後者は視覚-言語-行動アーキテクチャを使用しています。

あるゼロショット顧客展開では、DYNA-2の品質通過率は87%に達し、DYNA-1はわずか46%でした。

Dynaは、このモデルが物理的な干渉によってタスクが中断された際に、より良い耐久性を示すことを発表しました。食材の切断や作業エリアの清掃などの活動を含むテストでは、DYNA-2は人間の介入なしで回復できましたが、初期のモデルは手動での回復が必要でした。同社は、ビデオ共同トレーニング手法が、ロボットが指示に基づいて異なる物理的動作を実行するタスクにおいて133%のスコアを向上させたと述べています。「長年にわたり、汎用ロボットはデータボトルネックに悩まされてきました。手動で収集された物理的リモートデータは、汎用知能に拡張することができません」とDyna Roboticsの共同創設者であるJason Maは述べています。

「行動データは不足していますが、ビデオは至る所にあります。DYNA-2を通じて、物理的直感はロボットハンドで数百万時間のトレーニングを必要とせず、人間のビデオから直接学ぶことができることを示しました。」

Dyna Roboticsは、初期のDYNA-1モデルに基づくロボットがホテル、レストラン、自動洗濯機で使用されていると述べています。同社は、DYNA-2がロボットが新しい物理的タスクを学ぶ能力を向上させる一歩であり、大量の特定のロボットに依存したトレーニングデータを必要としないと考えています。同社はLindon Gao、York Yang、および元DeepMind研究者のJason Maによって設立され、CRVやFirst Roundを含む投資家からの支援を受けています。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle