アリババは7月21日に最新の画像生成基盤モデルQwen-Image-3.0を発表しました。このモデルは最大4.5k Tokenの超長入力をサポートし、数式記号、幾何学図形、論理推論ステップなどの多要素を融合した知識図解や複雑なユーザーインターフェースを一度に生成することができ、12言語と20以上のフォントのネイティブレンダリングにも対応しています。
報道によると、Qwen-Image-3.0は千問画像生成と編集モデルシリーズの第3世代基盤モデルであり、このモデルはライブ配信ページの生成においても卓越した能力を持ち、GPT-Image-2と同等の効果を簡単に実現できます。Qwen-Image-3.0の大きなポイントは、モデルの複雑な情報の処理能力を向上させたことで、前世代モデルに比べてテキスト入力の長さが4.5倍に増加しました。
Qwen-Image-3.0は画像生成の柔軟性と効率を向上させました
これは、映像短編のストーリーボード、複雑なインフォグラフィック、製品説明ページなど、超長いプロンプト入力が必要なシーンにおいて、ユーザーが要求を一言に圧縮する必要がなく、要求文書を書くように、画面構造、テキスト内容、視覚スタイル、レイアウトの詳細を完全に記述できることを意味し、再生成や手動調整のコストを削減します。
Qwen-Image-3.0は意味の並置と空間制御能力を駆使し、新モデルは一度に9つの異なる分野をカバーする9宮格の知識図解を生成できます。さらに、Qwen-Image-3.0は複雑な指示や画面の論理的なネスト関係を簡単に理解し、1つの指示に基づいて同じ画像内にウェブページ、ソフトウェアインターフェース、チャットウィンドウ、ポスターなどの多様な組み合わせビジュアルコンテンツを生成することができます。

