研究チームが新しい立体視覚アルゴリズムを開発、人型ロボットの深度認識が人間に近づく

カナダのトロント・ヨーク大学の研究チームは、最近「収束双眼立体視」(Convergent Binocular Stereo、CBS)と呼ばれる新しいアルゴリズムを発表しました。このアルゴリズムは、2つの前面カメラを搭載し、同じ目標に向かって収束できる人型ロボットのために設計されています。従来の立体視システムは通常、左右のカメラが平行であると仮定し、主に水平視差を計算しますが、新しいアルゴリズムは水平視差と垂直視差の両方を同時に処理し、カメラの動きを深度知覚プロセスに組み込むことで、ロボットが人間に近い方法で三次元シーンを理解できるようにします。

新アルゴリズムは人間の両眼収束メカニズムを模倣

CBSアルゴリズムは、まず2つのカメラを同じ三次元点に固定し、左右の画像間の幾何学的関係を特定します。その後、システムは5層のガウスピラミッドを構築し、異なる解像度で画像を分析します。粗い層では、アルゴリズムがSIFT特徴点を検出し、ペアリングし、極線制約を利用して水平および垂直視差を推定します。その後、Gaborフィルターが異なる方向とスケールでのテクスチャとエッジ情報を分析し、2つの画像間の対応するピクセルを識別するのを助けます。視差推定結果は低解像度から原解像度に向けて徐々に精緻化され、各段階で検索範囲が縮小され、最終的に生成された水平および垂直視差マップは三次元情報と深度推定に変換されます。

研究者によると、CBSは表面の傾斜、物体の姿勢、深度およびサイズの知覚スケールなどの情報も取得でき、人間に近いロボットの視覚処理方法を提供します。システムはカメラの収束と視差分析を組み合わせることで、ロボットが距離を判断し、物体の位置を識別し、複雑な環境でナビゲートする際に、従来の平行立体視法よりも優れた性能を発揮することが期待されています。

テスト結果は深度誤差が著しく低下したことを示す

アルゴリズムの性能をテストするために、研究チームはCBS-BMと呼ばれるベンチマークデータセットを作成しました。このデータセットには49のシーンが含まれ、一般的なデスクトップ環境、繰り返しテクスチャ、特徴の少ない表面、高度な自己遮蔽を持つ物体がカバーされています。各シーンは平行画像と、5から12対の収束点画像を同時に提供します。実験結果は、CBSが複数の既存の立体視法および深層学習システムと同等の性能を示し、全データセットにおいてその水平視差の平均値と深度誤差がテストされた平行法よりも低いことを示しています。

CBSの最大の利点は、繰り返しテクスチャのシーンを処理する能力にあります。従来のシステムはこのような環境で視覚的に類似した特徴点がどのように対応するかを判断するのが難しいことが多いです。このサブセットでは、CBSの平均深度誤差は最も劣った方法よりも約0.8メートル低く、水平視差誤差も約100ピクセル低いです。しかし、チームはまた、アルゴリズムが目標距離が遠くなると精度が低下し、正確なカメラキャリブレーションとモーターの位置決めに依存することを指摘しています。現在の実装はAMD Ryzen 7 7700Xプロセッサ上で約69秒の実行時間を要し、まだかなりの最適化の余地があります。

研究者は、CBSはすべての平行立体視システムを置き換えるものではなく、カメラの動きと視覚処理が協調して機能する人型ロボットに基盤を提供するものであると強調しています。人間の能動的な収束視覚を模倣することで、新しいアルゴリズムはロボットの深度知覚技術のさらなる発展を促進することが期待されています。

項目規格
アルゴリズム名Convergent Binocular Stereo(CBS)
開発チームカナダ・トロント・ヨーク大学
適用カメラ構成同じ目標に収束できる2つの前面カメラ
画像処理プロセス5層ガウスピラミッド、SIFT特徴マッチング、極線制約、Gaborフィルター
ベンチマークデータセットCBS-BM、49のシーンを含む
テストプラットフォームAMD Ryzen 7 7700Xプロセッサ

単回の運転時間約 69 秒

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle