Google は新しいアクティブビデオ理解機能を発表しました。この機能は、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite モデルで利用可能で、ビデオ分析の精度を向上させ、トークン消費とコストを大幅に削減することを目的としています。
アクティブビデオ理解の機能と利点
この新機能により、モデルはビデオクリップを動的にスキャンできるようになり、精度を向上させると同時に、トークン使用量を最大 88% 削減し、コストを最大 66% 削減できます。Google DeepMind のシニアプロダクトマネージャーは、この機能の導入がビデオ分析に革命的な変化をもたらすと述べています。
「私たちが本日発表したアクティブビデオ理解機能は、分析コストを大幅に削減し、精度を向上させました。」
アクティブビデオ理解機能の有効化方法
ユーザーは、Google AI Studio または Gemini Enterprise Agent Platform で API 設定を「agentic」にすることで、この機能を有効にできます。この機能は、10 分の教育ビデオや 90 分の講義など、長いビデオの処理に特に適しており、分析効率を大幅に向上させます。
「アクティブビデオ理解により、Gemini モデルは視聴する内容、速度、方法を自発的に決定できるようになり、開発負担が大幅に軽減されます。」
多様なアプリケーションシーン
アクティブビデオ理解機能は、開発者が長いビデオコンテンツを処理する方法を変え、迅速な瞬間検索、異常検出、物体カウントなど、さまざまなアプリケーションシーンをサポートします。これにより、自動化されたビデオ編集や複雑なクエリの実現がより実行可能になります。
「この技術は長いビデオ分析において顕著な効率向上を示し、大量のトークンを消費する必要がありません。」
今後、この機能は Google 製品の数十億のユーザーに段階的に展開され、YouTube の「Ask YouTube」機能でより高品質な回答を実現する計画です。
資料出典:Google 公式発表

