マサチューセッツ工科大学の研究者たちは、VLASHという新しい技術を開発しました。この技術は、ロボットが未来の位置に基づいて行動を計画できるようにすることで、より迅速、スムーズ、効率的に移動するのを助けます。この方法により、ロボットは次の位置を予測し、動作の間でシームレスに移行できるため、従来のシステムでよく見られる停止や振動が減少します。研究者たちは、この技術がロボットがピックアンドプレースなどのタスクを実行する際の速度を倍増させ、機械アームが卓球やモグラ叩きなどの動的な活動でより敏感になることを発見しました。チームによると、この技術は追加の計算コストを必要とせず、捜索救助や緊急対応で使用される機械の性能を向上させる可能性があります。
VLASH技術がロボットの性能を大幅に向上
生成型人工知能システム、特に視覚-言語-行動(VLA)モデルがロボットの脳としてますます使用されるようになり、これによりロボットは周囲の環境を解釈し、指示を理解し、物理的な行動を計画できるようになりました。しかし、VLA推論の計算要求は遅延を引き起こす可能性があり、ロボットが変化に対応する際に遅く、不流暢になることがあります。マサチューセッツ工科大学の研究者たちは、この問題を解決するためにVLASHという新しいシステムを開発しました。このシステムは、ロボットが現在の動作を実行しながら次の行動を計画できるようにします。
VLAモデルは通常、ロボットのカメラがキャプチャした視覚情報を処理し、それをタスクを説明する指示と組み合わせて、ロボットが実行する行動の断片を生成します。これらの行動が完了すると、システムは新しい観察結果を処理し、次のシーケンスを計画します。マサチューセッツ工科大学によると、この繰り返しのサイクルは動作の間に停止を引き起こす可能性があります。VLASHは、ロボットの未来の状態を予測することでこの遅延を排除することを目的としています。このシステムは、ロボットの現在の位置と環境に依存するだけでなく、現在の動作シーケンスを完了した後にロボットがどこにいるかを推定し、その情報を利用して次のステップを計画します。
研究者たちによると、この方法は古い観察結果に依存することによる不安定性を防ぐのに役立ちます。ロボットが移動する過程で周囲の環境が変化する可能性がありますが、現在の位置と計画された動作は、最近の未来の状態を推定するための十分な情報を提供します。この技術自体は、動作の断片間の遅延を排除することで、反応速度を30倍以上向上させることができます。研究者たちは、動作の量子化と呼ばれる方法を用いて性能をさらに向上させ、この方法は同じ軌跡に従うより大きな動作の断片を生成します。動作の量子化は精度をわずかに低下させますが、ロボットが全体として2倍から3倍の速度でタスクを完了することを可能にします。
今後の研究がVLASHの適用範囲を拡大
チームはまた、VLAモデルが未来の状態情報を効果的に利用できるようにするためのトレーニング強化技術を開発しました。既存のトレーニングデータを再編成し再利用することで、この方法は計算コストを増加させることなく、トレーニング時間を5倍短縮しました。シミュレーションでは、VLASHはより迅速なロボットの動作を継続的に生成し、同時に操作の正確性を維持しています。実際のロボットのテストでも、ピックアンドプレース、スタッキング、分類タスクにおける改善が示されました。あるデモでは、VLASHを使用したロボットが90%の精度を維持しながら、ベンチマークシステムの2倍の速度でカラフルなキューブを箱に分類し、従来の最良の方法と同等のパフォーマンスを達成しました。
マサチューセッツ工科大学のニュースによると、このシステムは卓球やモグラ叩きなどの高度に動的な活動も処理できるとのことです。研究者たちは、この技術がロボットを急速に変化する環境でより敏感かつ効率的にすることができると述べています。今後の研究では、VLASHを生成型人工知能の世界モデルと組み合わせる可能性を探求し、これらのモデルは実際の環境の観察結果を予測できるため、より複雑なロボットアプリケーションにおけるこのシステムの能力を潜在的に拡張することができます。

