Google 發佈 Android Bench 2.0 以應對複雜開發任務

Google 目前正在持續開發 Android Bench,最新版本為 2.0,反映出人工智能在處理更複雜的開發任務方面的能力。第一個版本專注於對現有代碼庫進行增量改進,例如修復錯誤或較小的功能請求。而 Android Bench 2.0 針對的是「需要工程師多天甚至一週才能完成的高複雜度任務」,例如添加新特性、從零開始構建應用程式以及將跨平台應用轉換為 Android。

這一新的重點要求「更細緻的評估和打分」,超越了通過或失敗的評分標準。Google 正在從二元評分轉向持續評分:我們通過功能性、視覺真實性、避免回退等多種因素來計算這一完成率。我們還對偏離評估指示或結構約束的情況施加客觀的評分懲罰。

Android Bench 2.0 將重點放在高複雜度任務的評估上

Google 已對 Gemini 3.7/3.8 Flash、OpenAI GPT-6、Anthropic Fable 5.1、Kimi K3 和 Qwen 3.8 Max 進行評分。GPT-6 Astra 在基準測試中名列前茅,通過率達到 28%(相比之前方法中 90% 的分數範圍)。Google 分享了一些見解,例如「將跨平台應用移植到 Android 仍然是一項未解決的挑戰——沒有任何模型能達到 100% 的通過率,最前沿的模型最多達到 80% 的完成率。」

「人工智能在編寫新代碼方面的表現優於重構現有代碼。重構和遷移變得更加棘手,因為成功與否取決於架構的複雜性,而非代碼的量。」此外,「模型在進行確定性轉換(例如將 Java 轉換為 Kotlin、將 Retrofit 換成 Ktor 或引入 ViewModel 層)時展現出強大的能力。」這些模型在任務需要運行時驗證(例如缺少依賴注入圖)、涉及重大框架變更或面臨未發布庫的知識空白時則顯得力不從心。

通過代理評估,Android Bench 執行了「來自相應模型提供者的代理」,例如在 Google Antigravity 上運行的 Gemini 3.8 Flash 和使用 Codex 的 GPT-5.6 Sol。Google 表示,「利用設計積極影響開發者的結果」,Android Bench 計劃在未來納入不同模型和代理的組合。

Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)