開発者はしばしば一つの痛点に直面します:AIモデルに直接コンピュータを制御させてタスクを完了させたいと考えています。例えば、ウェブページを閲覧したり、フォームに記入したり、ソフトウェアを操作したりすることですが、従来のAPIの制限により、モデルはテキスト入力のみを処理でき、デスクトップ環境を実際に「見る」ことや「操作」することができません。Self Operating Computerフレームワークはこの問題に対処し、GPT-4Vのようなマルチモーダルモデルが視覚理解とマウス・キーボード制御を通じて、自律的に複雑なコンピュータタスクを実行できるオープンソースの解決策を提供します。このツールは特にAI研究者、自動化エンジニア、およびインテリジェントエージェントを構築したい開発者に適しており、ゼロから低レベルの制御コードを書くことなく、AIコンピュータ操作を迅速にプロトタイピングできます。
マルチモーダルモデル -m モードでデスクトップを直接観察・制御
Self-Operating Computerの核心は、-mパラメータで起動するマルチモーダルモデルモードにあります。これにより、コンピュータの画面をリアルタイムでキャプチャし、GPT-4Vのようなモデルに分析させます。モデルは画面要素を認識するだけでなく、ボタンの位置やテキスト内容を識別し、正確なマウスクリックやキーボード入力の指示を生成します。この設計により、AIは人間のようにオペレーティングシステムを操作し、簡単なナビゲーションから複雑なワークフローまでさまざまなタスクを処理できます。例えば、ウェブページの登録プロセスを自動化したい場合、フレームワークは連続して画面をキャプチャし、変化を分析し、モデルの指示に基づいて操作を調整することで、開発者が手動でスクリプトを書く負担を大幅に軽減します。

Voice Mode –voiceによる音声指令でコンピュータ操作を駆動
-voiceモードを起動すると、ユーザーは自然な音声で指示を出すことができ、フレームワークは音声をテキストに変換し、画面入力と組み合わせてマルチモーダルモデルに処理させます。この機能はハンズフリーのシーンで特に便利で、例えば開発者が話しながらタスクをデモンストレーションすると、AIは音声に従ってリアルタイムでコンピュータ操作を実行します。純粋なテキスト入力と比較して、音声モードはよりスムーズで自然であり、音声アシスタントやリモート制御システムの構築に適しています。フレームワークには音声認識が内蔵されており、指示がモデルに正確に伝達されることを保証し、画面のフィードバックにより操作プロセスが透明で追跡可能です。
実際の操作では、ブラウザを開いた後に「GoogleでAIフレームワークを開く」というカスタム指示を入力すると、モデルは自動的にブラウザをクリックし、キーワードを入力してEnterを押します。このすべてのプロセスは画面のスクリーンショットによって駆動され、追加のプラグインは不要です。この点は同類のツールの中では珍しく、ほとんどのフレームワークは単一のアプリケーションに制限されていますが、Self-Operating Computerは全デスクトップ環境をサポートしています。
OCRモード -m gpt-4-with-ocrで画面のテキストを正確に識別
画面のテキストが密集しているタスクに対して、-m gpt-4-with-ocrモードを有効にすると、識別精度が大幅に向上します。このモードはGPT-4とOCR技術を組み合わせて、画面上のすべてのテキストを抽出し、視覚的コンテキストをモデルの意思決定に結びつけます。標準のマルチモーダル入力と比較して、OCRモードは小さなフォントやぼやけた画面をより信頼性高く処理できます。例えば、PDFファイルや古いソフトウェアインターフェースで自動的にフォームに記入したり、コンテンツを検索したりすることができます。開発者はこの機能を使用してデータ抽出タスクを自動化し、大量の手動作業を節約できます。
Set-of-Mark Prompting -m gpt-4-with-somで複雑なタスクのプロンプトを最適化
Set-of-Mark Promptingモード(-m gpt-4-with-som)は、フレームワークの高度なテクニックで、画面の重要な要素(ボタンを色で囲むなど)にマークを付けることで、モデルに対してより構造化されたプロンプトを生成します。この方法は、複雑なインターフェースでマルチモーダルモデルが「迷子」になる問題を解決します。例えば、長い表や多層メニューの操作などです。マーク付けシステムは自動的に生成され、モデルはそれに基づいて正確なアクションシーケンスを生成します。高い信頼性が求められる自動化プロセスに適しています。従来のプロンプトエンジニアリングと比較して、このモードはより直感的で、開発者は簡単に設定するだけで適用できます。
総じて、Self-Operating Computerは、マルチモーダルAIが真に「自動操作」するための柔軟なフレームワークを提供します。音声から視覚OCR、さらにはマーク付きプロンプトまで、各モードが相互に補完し、完全なツールチェーンを形成します。AIエージェントを探求したい開発者にとって、このGitHubプロジェクトは試す価値があります。
製品名:Self-Operating Computer / self-operating-computer
公式サイト:https://github.com/OthersideAI/self-operating-computer

