ChatGPT iOSアプリにジェスチャー機能追加、最近の写真を簡単にアップロード可能に

次世代のビジュアル検索アシスタントとして、ChatGPTは今週iOSエコシステムで使用プロセスを再度最適化し、ユーザーが会話に最近の写真を追加するのがより迅速になりました。以前は、ユーザーはまず + ボタンをクリックし、「Photos」を選択してアルバムから選ぶ必要がありました。このプロセスは複雑ではありませんが、複数の写真を迅速にアップロードしたり、複数のビジュアルクエリをリンクしたりする必要がある場合、自然な会話のリズムが中断されることがあります。OpenAIのAdam Fryがコミュニティで示唆したように、今では会話ボックスの左側にある + ボタンを長押しするだけで、システムの最近の4枚の写真のクイックセレクションパネルが表示され、その中から1枚を選択することで写真を会話に添付し、直接質問をしたり、プロンプトに組み込んだりすることができます。この新しいジェスチャーの導入は、今週の他の強化とともに登場しました。例えば、現在の時間をより正確に取得すること、長文の会話のウェブ版での読み込みと応答速度を向上させること、ネットワーク接続待機中により明確なユーザーインターフェイスの更新を提供することなどです。この変化は、OpenAIがより直感的なインタラクションデザインを通じて、日常のビジュアルクエリのハードルを下げ、ユーザーが会話の流れを中断することなく迅速な「ビジュアル検索」を完了できるようにしていることを示しています。

バックグラウンドでは、Visual Intelligence機能はiOSシステムでほぼ2年間運用されていますが、現在のところ比較的新しいiPhoneのみをサポートしており、グローバルな地域カバレッジには依然として制限があります。ChatGPTを使用して類似のビジュアル検索を実行するユーザーにとって、新しいジェスチャーはより即時的な代替手段を提供します。インターフェースを切り替えたり手動で選択したりすることなく、会話ボックス内で最近の写真を迅速に送信でき、クエリが現場の状況により近づきます。このような変更は、OpenAIが「ビジュアルコンテキスト」を重視していることを示しており、よりスムーズなクロスデバイスのインタラクション体験を提供しています。従来のプロセスと比較して、このアプローチは忙しい日常業務の中で作業効率を向上させる可能性があり、特に実物の外観とテキストの説明を迅速に照合する必要があるタスクにおいて有用です。

新しいジェスチャーがChatGPTのビジュアルクエリをより直感的にし、クロスデバイスの協調のリズムを促進

さらに、今回の更新は迅速なアップロードに焦点を当てるだけでなく、ユーザーが同じ画面内で「写真を選択」から「ビジュアル関連の質問をする」までの一連のプロセスを完了できるようにしています。実際の操作では、ユーザーが + ボタンを長押しすると、システムは最近の4枚の写真を表示し、その中のいずれかを選択して添付形式で会話に追加し、その後は会話ボックス内で直接コマンドを追加したり、詳細を説明したり、写真の内容に関する具体的な質問をしたりできます。このデザインの核心は認知負荷を軽減し、ユーザーが複数のインターフェース間を切り替えることなく、写真を中心としたクエリシーンを迅速に構築できるようにすることです。さらに、写真が複数の時間点からのものである場合、最近の数枚を迅速に選択することは、比較と推論を効率的に行うのに役立ち、日常のショッピング、画像編集、旅行計画などのシチュエーションに特に適しています。これは、OpenAIが依然としてユーザーシーンを重視し、より直感的な操作を通じて画像検索の普及を推進していることを示しています。

現在の更新は、パフォーマンスと安定性にも注目しており、フロントエンドインターフェースのリアルタイム応答を向上させるだけでなく、長文の会話のウェブ版での処理速度も改善されました。会話の中で複数のビジュアルコンテンツを継続的に引用したり比較したりする必要がある場合、このような最適化は待機時間を大幅に削減し、全体の体験をよりスムーズにします。より明確な接続待機指示は、ユーザーがネットワークが不安定なときでも現在の状態をより早く理解できることを意味し、表示の遅延による混乱を避けることができます。これらの変化はすべて、ChatGPTがデジタルビジュアルクエリの分野で、より堅牢で直感的なデザインを通じて、日常の仕事やエンターテイメントシーンの実用性を向上させていることを示しています。

地域とデバイスのカバレッジに関しては、Visual Intelligenceの普及速度はデバイスと地域に制限されていますが、OpenAIは関連するサポートとユーザー体験の最適化に引き続き注力しています。ユーザーにとって、今後の更新でより広範なデバイスサポートとより迅速なクロスデバイス同期が実現すれば、ビジュアルクエリの実用性とアクセス可能性が大幅に向上するでしょう。OpenAIのこの一連の改善は、開発者コミュニティがサードパーティアプリケーションにより自然なビジュアル対話の参照を追加することを促進し、「見えることが理解すること」につながる仕事やエンターテイメントシーンをさらに拡大する可能性があります。

比較と展望:他の同類型AIとの違いと今後の方向性

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle