Grounded SAM:テキストプロンプトによる自動検出・分割と画像生成

画像をデザインしたり写真を編集したりする際に、「赤いスポーツカー」や「青空と白い雲」を正確に選択したいと思ったことはありませんか?しかし、従来のツールでは手動でフレームを描いたり、魔法の杖を使って苦労したりする必要があり、多くの時間を浪費してしまいます。Grounded SAMは、これらの痛点を解決するために生まれたオープンソースツールで、Grounding DINO、Segment Anything、Stable Diffusionなどの最先端モデルを組み合わせ、テキストによる説明だけで指定したオブジェクトを自動的に検出、分割、さらには生成することができます。このツールは、画像処理の開発者、デザイナー、AI愛好者に特に適しており、数秒以内に複雑なタスクを完了し、作業効率を大幅に向上させます。

GroundingDINOを使ったテキストプロンプトによる画像中の任意のオブジェクトの検出

Grounded SAMの基盤はGrounding DINOモデルにあり、この部分は自然言語のテキストプロンプトを使用して、画像中に求めるオブジェクトを検出することに焦点を当てています。例えば、「猫」や「停泊している船」と入力すると、該当するすべての領域を自動的にフレームで囲み、色や形状に頼って手動でフィルタリングする必要がありません。このようなオープンボキャブラリーの検出方法は、従来のオブジェクト検出器よりも柔軟性があり、事前定義されたカテゴリに制限されず、日常的なアイテムから抽象的な概念まで自由に記述できます。

実際の操作では、画像を読み込み、プロンプトを入力するだけで、モデルが即座にバウンディングボックスを生成し、精度はプロフェッショナルレベルに達します。開発者にとって、この機能は簡単なPythonコマンドを通じて自分のワークフローに統合でき、大量の前処理ステップを省略できます。

GitHub - IDEA-Research/Grounded-Segment-Anything: Grounded SAM: Marrying Grounding DINO with Segment Anything & Stable Diffusion & Recognize Anything - Automatically Detect , Segment and Generate Anything · GitHub 介面截圖
GitHub – IDEA-Research/Grounded-Segment-Anything: Grounded SAM: Marrying Grounding DINO with Segment Anything & Stable Diffusion & Recognize Anything – Automatically Detect , Segment and Generate Anything · GitHub公式ページのスクリーンショット

Grounded-SAMによるテキストプロンプトを用いた精密なオブジェクト分割

オブジェクトを検出した後、Grounded-SAMは自動的にSegment Anythingモデルに接続し、バウンディングボックスをピクセル単位の精密マスクに変換します。このステップは、従来の検出が粗いフレームしか提供しない問題を解決し、背景の雑物を含まずに、例えば走行中の車のきれいなオブジェクトの輪郭を得ることができます。全体のプロセスは一度のテキストプロンプトで行われ、モデルは自動的に複数の候補マスクを生成し、最も適したものを選択できます。

Segment Anythingを単独で使用する場合と比較して、Grounded-SAMの利点はテキストガイドを追加することで、クリックや選択の手間を省ける点です。この機能は、画像編集ソフトウェアや自動化パイプラインにおいて特に便利で、例えば画像中の不要な要素を迅速に削除したり、後続の生成タスクのための素材を準備したりすることができます。

インペインティング機能による自動生成で空白を埋める

Grounded SAMの最も強力な拡張機能は、Stable Diffusionのインペインティング機能を統合していることです。分割が完了した後、「緑の草地に置き換える」といったテキストプロンプトを指定すると、モデルは空白の領域を埋める新しいコンテンツを自動的に生成し、自然で目立たない移行を確保します。このプロセスは、検出から生成まで一貫して行われ、背景の置き換えやオブジェクトの置き換えなどのクリエイティブな編集に適しています。

さらに、Recognize Anythingモデルは認識精度を向上させ、複雑なシーンでのオブジェクトをより簡単にキャッチできるようにします。アーティストやコンテンツクリエイターにとって、このような全自動生成能力は、Photoshopなどの専門ソフトウェアに依存せずにデザインプロトタイプを迅速に反復できることを意味します。

Gradio APPが直感的なインターフェースで迅速なテストを提供

非開発者のために、Grounded-SAMにはGradioウェブインターフェースが内蔵されており、数コマンドでローカルAPPを起動できます。ブラウザを開いて画像をアップロードし、プロンプトを入力し、ボタンをクリックするだけで、検出、分割、インペインティングの結果がすぐに表示されます。Dockerのワンクリックインストールをサポートしており、NVIDIA GPU環境がなくてもCPUモードで実行できるため、速度はやや遅くなりますが、利用可能です。

このAPPは、信頼度の閾値やマスクの精度などのパラメータを調整することも可能で、ユーザーが出力を微調整できます。プロトタイプの研究や日常的な実験において、即座に効果をプレビューできるため、AIツールの導入ハードルを下げています。

製品名:Grounded SAM / Grounded-Segment-Anything
公式サイト:https://github.com/IDEA-Research/Grounded-Segment-Anything

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle