GoogleはGemini Robotics 2を発表しました。これは新しいタイプのロボットモデルで、全身型ロボットを制御し、歩行、曲がり、バランスを取り、物体を操作する能力を備え、複雑なタスクを遂行することを目的としています。同社によれば、このシステムは複数のロボットを調整することもでき、数時間のトレーニングで異なるロボットのボディに適応することが可能です。この発表は、今年初めに発表されたGemini Roboticsを基にしたもので、能力はデスクトップ操作にとどまらず、全身運動をカバーしています。
Googleはさらに2つの補助モデルを発表しました:Gemini Robotics ER 2は高度な推論用、Gemini Robotics On-Device 2はロボット上でローカルに動作し、クラウド接続を必要としません。
従来のプログラミングによる反復タスクのロボットとは異なり、これらの新しいモデルは推論を通じて動作を実行し、不慣れな環境に適応し、最小限の再トレーニングで複数のステップの作業を実行するように設計されています。Googleは、この視覚-言語-行動モデルが全身型ロボットや二腕ロボットシステムを制御でき、家庭や産業のタスクを二手またはロボットのグリッパーを使って実行できると述べています。最大の変化の一つは全身制御です。初期のモデルは主に上半身の動きに焦点を当てていましたが、Gemini Robotics 2はロボットが部屋内を歩き、しゃがみ、伸び、物体と相互作用できるようにします。
デモでは、GoogleのモデルがApptronikのApollo 2全身型ロボットを制御し、水やり用のジョウロを拾い、部屋を横切り、低い棚に置くよう指示しました。
Gemini Robotics 2はロボットの柔軟性と協調能力を向上させます
同一モデルのチェックポイントは、Franka Duoを含む他のロボットプラットフォームにも適用され、異なるロボット実体間での作業能力が強調されています。Googleは、このモデルが柔軟性を向上させるとも述べています。Apollo 2の五指ロボットハンドを操作し、ゴミ袋を結ぶ、Ziploc袋を閉じる、電球を取り外すなどのタスクを実行できます。二指グリッパーを使用する産業プラットフォームでは、正確な挿入タスク、ツール処理、物体配置を実行できます。同社はまた、Google AI Studioを通じて、具身推論モデルGemini Robotics ER 2を提供し、Gemini Enterprise Agent Platform上でプライベートプレビューを行っています。
視覚-言語-行動モデルとローカルモデルは、初期アクセスパートナーに向けてリリースされています。
よりスマートなロボットチームワーク Googleは、Gemini Robotics ER 2がロボットの高度な推論エンジンとして、口頭指示を理解し、それを複数のステップに分解し、タスクが完了するまで進捗を監視できると述べています。更新されたモデルは、数分間続くタスクのシーケンスを実行し、数百の決定を行うことができます。また、失敗した行動から回復し、固定されたルーチンに従うのではなく、変化する環境に適応することができます。もう一つの新しい能力は、複数のロボットの協力です。異なるタイプのロボットが通信し、役割分担を行い、単一のロボットでは難しいタスクを完了することができるようになりました。
インターネットに接続できないアプリケーション向けに、GoogleはGemini Robotics On-Device 2を発表しました。同社によれば、このモデルはロボットハードウェア上でローカルに動作し、200未満のトレーニングサンプルで数時間以内に新しい二腕ロボット設計に適応できるとのことです。
さらに、GoogleはASIMOV-Agenticを発表しました。これはロボットの安全性を評価するための新しいベンチマークで、ロボットが不安全な行動を拒否するか、曖昧さを認識し、必要に応じて人間の助けを求めるかを評価します。同社は、Gemini Robotics ER 2が人間接近検出能力を向上させ、人間がいる場合に安全に停止できるようにしたとも述べています。

