InfoQ · AI/ML· Sergio De Simone·· 3 小时前AI 评分35
Android Bench 2.0 增加对长周期任务、智能体评估和持续评分的支持
Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring
AI 导读
Android Bench 2.0 引入长周期任务(LHTs)、基于智能体的评估和持续评分机制,以更准确衡量 AI 模型在复杂 Android 开发任务中的表现。该版本新增的任务包括从零构建应用、升级依赖项和跨平台应用迁移,评估方式从二元通过/失败改为多维度评分系统。目前 Claude Opus 5.5 在 LHT 任务中以 32% 的通过率位居榜首,其次是 GPT 6 Astra 的 28%。
来源:InfoQ · AI/ML · infoq.com