跳到正文
热点事件持续更新

Android Bench 2.0发布,新增长周期任务与智能体评估

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Google发布了Android Bench 2.0基准框架,新增对长周期任务、基于智能体的评估和持续评分的支持,以更准确衡量AI模型在复杂Android开发任务中的表现。 新版本的任务类型包括从零构建应用、升级依赖项和跨平台应用迁移,评估方式从二元通过/失败改为多维度评分系统。 根据该基准的评估结果,Claude Opus 5.5在长周期任务中以32%的通过率位居榜首,其次是GPT 6 Astra的28%。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月10日
  1. InfoQ · AI/ML
    Android Bench 2.0 增加对长周期任务、智能体评估和持续评分的支持

    Android Bench 2.0 引入长周期任务(LHTs)、基于智能体的评估和持续评分机制,以更准确衡量 AI 模型在复杂 Android 开发任务中的表现。该版本新增的任务包括从零构建应用、升级依赖项和跨平台应用迁移,评估方式从二元通过/失败改为多维度评分系统。目前 Claude Opus 5.5 在 LHT 任务中以 32% 的通过率位居榜首,其次是 GPT 6 Astra 的 28%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。