跳到正文
Hacker News · AI· lukaspetersson·· 4 小时前AI 评分41

TasteVal:评估 AI 在 AI 研究任务中的实验研究品味

TasteVal: Does AI have research taste?

AI 导读

TasteVal 是一个用于评估 AI 模型在 AI 研究任务中实验设计能力的基准,其核心指标是实验计算效率。自 2025 年 12 月起,前沿模型的实验研究品味每 3.0 个月翻倍(95% 置信区间 1.7-5.0 个月)。Opus 5.5 在实验计算效率上达到人类专家的 2.30 倍(95% 置信区间 1.15-4.37 倍),且单次尝试成本仅为人类专家的 1/30。

来源:Hacker News · AI · pzeroresearch.com