跳到正文
热点事件持续更新

Scale AI 因基准可被操控移除 SWE-Bench Pro 89项任务

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Scale AI 在独立预印本指出其代码修复基准 SWE-Bench Pro 存在可被操控的问题后,从公开排行榜中移除了89项任务,并发布了修复这些问题的新版本。 独立预印本发现该基准存在奖励黑客行为、答案泄露和测试范围不当等问题。Scale AI 随后将任务总数从731项降至642项,并新增了51项 HARD 子集任务。 新版本(V2)已成为默认配置,旧版作为v1保留。新版本在智能体阶段关闭网络访问,并在纯净环境中重放每个补丁,但无法清除模型在训练中已见过的内容。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. Hacker News · AI
    SWE-Bench Pro 移除 89 项任务:独立审计发现基准可被操控

    Scale AI 在独立预印本指出 SWE-Bench Pro 存在奖励黑客、答案泄露和测试范围不当等问题后,从公开排行榜中移除 89 项任务,将任务总数从 731 降至 642,并新增 51 项 HARD 子集。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。