Googleは現在、Android Benchの開発を継続しており、最新バージョンは2.0で、人工知能がより複雑な開発タスクを処理する能力を反映しています。最初のバージョンは、既存のコードベースに対する増分改善、例えばバグ修正や小さな機能要求に焦点を当てていました。一方、Android Bench 2.0は「エンジニアが数日から1週間かかる高複雑度のタスク」に対応しており、新機能の追加、アプリケーションのゼロからの構築、クロスプラットフォームアプリのAndroidへの変換などが含まれます。
この新しい焦点は「より詳細な評価とスコアリング」を要求し、合格または不合格の基準を超えています。Googleは二元評価から継続的評価に移行しており、機能性、視覚的リアリティ、後退の回避などの多くの要因を通じてこの完了率を計算しています。また、評価指示や構造的制約からの逸脱に対して客観的なスコアペナルティを課しています。
Android Bench 2.0は高複雑度タスクの評価に重点を置いています
Googleは、Gemini 3.7/3.8 Flash、OpenAI GPT-6、Anthropic Fable 5.1、Kimi K3、Qwen 3.8 Maxの評価を行いました。GPT-6 Astraはベンチマークテストでトップの成績を収め、合格率は28%に達しました(以前の方法では90%のスコア範囲)。Googleは、「クロスプラットフォームアプリをAndroidに移植することは依然として未解決の課題であり、どのモデルも100%の合格率には達していない。最前線のモデルでも最大80%の完了率にとどまっている」といった見解を共有しました。
「人工知能は新しいコードを書く能力において、既存のコードをリファクタリングする能力を上回っています。リファクタリングや移行は、成功がコードの量ではなくアーキテクチャの複雑さに依存するため、より厄介になっています。」さらに、「モデルは、JavaをKotlinに変換したり、RetrofitをKtorに置き換えたり、ViewModel層を導入したりするような決定的な変換を行う際に強力な能力を示します。」これらのモデルは、実行時検証が必要なタスク(例えば、依存性注入グラフの欠如)、重大なフレームワークの変更が関与する場合、または未発表のライブラリに関する知識の空白に直面する場合には力を発揮できません。
代理評価を通じて、Android Benchは「対応するモデル提供者からの代理」を実行しました。例えば、Google Antigravity上で動作するGemini 3.8 Flashや、Codexを使用したGPT-5.6 Solなどです。Googleは、「デザインを活用して開発者の結果に積極的な影響を与える」ことを示しており、Android Benchは将来的に異なるモデルと代理の組み合わせを取り入れる計画です。

