人間の手を模したロボット設計の課題:家事がロボットにとって難しい理由

人型ロボットは走ったり、ジャンプしたり、バク転したり、さらにはダンスをしたりすることができますが、シャツを畳んだり、湿ったスポンジを持ち上げたり、鍵を回したりするように求められると、問題はより難しくなります。これは直感に反するように思えます。バク転は見た目にはシャツを畳むよりもはるかに複雑に見えますが、ロボットにとってはバク転は予測可能な動作のシーケンスであり、制御プロセスは非常に正確です。しかし、家庭での作業は不確実性に満ちています。物体は曲がり、滑り、変形し、壊れ、毎回出現する位置がわずかに異なります。したがって、ロボットの手は、本当に役立つ人型ロボットを構築する上で最も挑戦的な部分の一つかもしれません。

手は単なる指の集合ではありません。人間の手は、非常にコンパクトなパッケージの中に機械、感覚、制御を組み合わせています。私たちは意識的に考えることなく、常に握り方を調整しています。物体が滑り始めたときには指を緩め、物体が重いときには握力を強め、物体が予期せず柔らかいときには握り方を変えます。ロボットはこれらの機能を実現するためにセンサーとソフトウェアに依存する必要があります。

ロボットの手の柔軟性と家庭環境の課題

現代のロボットの手は複数のモーターと自由度を持つことがありますが、それが自動的に柔軟性を持つわけではありません。ロボットは、指の位置、物体の位置、接触の強さ、滑り具合、安全に力を加える程度を知る必要があります。これは特に困難で、視覚だけではすべての情報を提供できません。カメラはロボットに卵を握っていることを知らせることができますが、それを壊すまでの距離を直接教えることはできません。最近の研究では、触覚センサーの重要性が高まっています。2026年、浙江大学の『サイエンスロボティクス』の研究は、視覚と触覚の情報を組み合わせ、強化学習とオンライン模倣学習を利用して、25の物体を含む5つの複雑なタスクで85%の成功率を達成しました。

現実の世界は厄介なほど予測不可能です。工場のロボットは、エンジニアが環境を制御できるため、巨大な利点を持っています。同じ部品を何千回も組み立てるロボットアームは、固定された軌道、予測可能な照明、既知の物体のサイズ、特別なツールを得ることができます。しかし、家庭環境はまったく逆です。シャツを畳む方法は毎回異なる可能性があり、ガラスのコップは部分的に満たされているかもしれませんし、引き出しはわずかに開いているかもしれません。スポンジは圧縮されると形が変わり、プラスチック袋には固定された幾何学的形状がありません。オハイオ州立大学の研究者は、これを家庭用ロボットの基本的な問題の一つとして説明しています:物理的接触はモデル化と制御が難しく、特に物体が柔らかく、壊れやすく、不規則な場合はなおさらです。

さらに、操作中にロボットはしばしば動いています。家庭用ロボット学の研究では、両手の協調、安定したナビゲーション、十分な到達性が現実世界での全身制御の三大要件であることが確認されています。言い換えれば、手は単独で考慮することはできず、腕、体、環境と組み合わせる必要があります。

これは人型ロボットの進展の奇妙な現象を説明しています。UnitreeのH1はその立ちバク転が有名で、G1はますます運動能力のある動作を示しています。しかし、バク転は明確に定義された動作です。ロボットは自分が何をしているのかを知っており、環境は制御可能であり、このプロセスを繰り返し練習することができます。シャツを畳むことは異なります。シャツを畳むロボットは、生地を見つけ、その変化する形を理解し、掴むポイントを選び、物を失わずに引っ張り、手を再配置し、しわを考慮し、最終結果を正確に置く必要があります。

100種類の異なるシャツを扱うと、この問題は突然、単純な動作のようには見えず、巨大な物理実験のように思えます。

中国のロボット企業はこの問題に直面しています。最近、ロイターは「走ったり踊ったりした後、中国のロボット企業が家庭の雑務を狙う」というタイトルの報道を行いました。報道に登場した企業X Square Robotは、他の多くのロボット企業と共に、ゴミを拾ったり花を配置したりするなど、家庭の雑務における人型ロボットのテストを行っています。欠けている重要な要素はデータです。現代のロボットはますます訓練に依存しており、単にプログラミングするだけではありません。しかし、有用な操作データを収集することは、AIモデルのために画像を収集するよりもはるかに難しいのです。

有用なデモには、ロボットの関節位置、カメラ、力、トルク、触覚センサーの同期情報が必要です。また、人々が数千の物体を操作する際に、同時に彼らの手の感覚を記録するためのインターネット規模のデータセットは存在しません。IEEEは最近、触覚データが主要なボトルネックであると強調し、視覚-言語-行動モデルが洗濯や整理などのタスクを処理するのに役立っている一方で、精密操作は依然として難しいと指摘しています。その一因は、触覚データセットが視覚データセットと比較して非常に小さいためです。

したがって、企業や研究者は遠隔操作、ウェアラブルセンサー、模倣学習、強化学習、シミュレーションを試みています。目標は、人間のデモを十分な訓練経験に変換し、ロボットが最終的に不慣れな状況を独立して処理できるようにすることです。業界全体が同じ欠けているスキルを追求しています。業界内の著名な企業は、この問題に異なるアプローチで取り組んでいます。たとえば、UnitreeのG1は、力制御の三指マニピュレーターとオプションの触覚センサーを装備できます。ApptronikのApolloは、操作と動作の周りで開発を進めており、同社はそのコアドライバーの35以上のイテレーションを説明しています。

TeslaのOptimusも汎用ヒューマノイドロボットの同じ目標を追求しており、1XのNEOは明確に家庭での作業を対象としています。これらの例は、家庭用ロボットの問題が解決されたことを意味するものではありません。ロボットが特定のタスクを信頼性を持って実行できることと、未知の家庭に入り、8時間監視なしで作業することを要求されることは全く異なります。これが最終的にロボットアームを非常に難しくしています。人間は単に指を動かすだけではありません。私たちは常に感知し、予測し、指の動きを修正しています。ロボットが同様のサイクルを実行できるようになるまで、壮観なバク転を完了できるロボットであっても、タオルを拾うといった簡単なタスクで苦労する可能性があります。

項目規格
研究機関浙江大学
成功率85%
参加物体数25

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle