スイスの実体人工知能会社Mimic Roboticsは、Black Forest Labsと共同開発した次世代ビデオアクションモデルFLUX-mimicを発表しました。このモデルは、ロボットがビデオデモから複雑な高柔軟性の産業タスクを学習できるように設計されています。同社は、このシステムに必要なデモデータが既存の方法のごく一部であるため、工場環境でのロボットトレーニングがより迅速かつ効率的になると述べています。FLUX-mimicは、Mimicのロボット学習、巧妙な操作、および産業自動化に関する専門知識と、Black Forest LabsのFLUX 3ビデオモデルを組み合わせたものです。
チームによると、このシステムはMimicの初期のビデオアクションモデル研究に基づいており、アーキテクチャは現実世界の実体人工知能アプリケーションに特別に設計されています。
FLUX-mimicの進化したビデオモデルの特徴
FLUX-mimicは、Black Forest Labsと共同開発された次世代ビデオアクションモデルとして市場に位置付けられており、産業用ロボットがビデオデモから複雑な操作タスクを学習できるようにし、必要なトレーニングデータが既存の方法よりも大幅に少なくなります。ほとんどの視覚-言語-行動(VLA)モデルに依存するロボット学習システムとは異なり、FLUX-mimicは生成ビデオ基盤モデルの上に構築されています。従来のVLAシステムは通常、静止画像とテキストデータセットで事前トレーニングされており、物理的相互作用を学習するために高価なロボットデモデータにほぼ完全に依存する必要があります。
これに対して、FLUX-mimicは、すでに大規模なビデオ事前トレーニングを通じて物体の動態、運動、および物理的相互作用を学習したビデオモデルを利用し、その後ロボット制御に適応します。このシステムは、ビデオモデルとアクションデコーダーを組み合わせてロボットの行動を予測し、このデコーダーが視覚予測を実行可能なロボットアクションに変換します。このアーキテクチャにより、ロボットは物理的スキルをより効率的に学習でき、デプロイに必要なタスク特定データの量を減少させることができます。
Mimic Roboticsは、FLUX-mimicがわずか30分のロボットデモデータで微調整できると述べており、これは従来の学習プロセスで通常必要とされる30時間以上のデータと比較して、トレーニングデータの必要量を大幅に削減しています。この削減により、デプロイメントサイクルが数ヶ月から数週間に短縮されると予想されています。
工場人工知能技術の加速
この技術は、Mimic Roboticsの初期のビデオアクションモデル研究に基づいており、事前トレーニングされたビデオ生成モデルの能力を拡張し、ロボットの行動を予測できるようにしています。FLUX-mimicはこの基盤の上にさらに進化し、アーキテクチャは産業環境における実体人工知能アプリケーションに特別に設計されており、ロボットが運動や物体の挙動をよりよく理解し、その後タスクを実行できるようにします。同社は自動車メーカーのアウディと協力し、この技術の現実の工場環境での性能を評価しています。この協力は、柔軟な材料や精密な操作を含む高柔軟性タスクの自動化に焦点を当てており、これらのアプリケーションは従来の産業用ロボットにとっては困難であり、多くのプログラミングと頻繁な再エンジニアリングを必要とします。
アウディの生産施設はすでに高度な自動化を使用しており、変化する生産ニーズに適応できる学習型ロボットシステムのテスト環境を提供しています。パートナーは、ビデオアクションモデルがどのようにエンジニアリング作業を削減し、ロボットのデプロイを加速し、製造および物流操作における自動化を拡大できるかを探求しています。同社は、大規模なビデオ理解とロボットの行動予測を組み合わせることで、FLUX-mimicが手動プログラミングのワークフローに依存するのではなく、比較的少量のデモデータから新しい産業スキルを学ぶロボットの変革を表していると主張しています。
このアプローチは、製造の柔軟性を改善し、複雑で変化の激しい生産環境におけるロボット自動化をより実用的にすることを目指しています。

