Hacker News · AI· lukaspetersson·· 4 小时前AI 评分41
TasteVal:评估 AI 在 AI 研究任务中的实验研究品味
TasteVal: Does AI have research taste?
AI 导读
TasteVal 是一个用于评估 AI 模型在 AI 研究任务中实验设计能力的基准,其核心指标是实验计算效率。自 2025 年 12 月起,前沿模型的实验研究品味每 3.0 个月翻倍(95% 置信区间 1.7-5.0 个月)。Opus 5.5 在实验计算效率上达到人类专家的 2.30 倍(95% 置信区间 1.15-4.37 倍),且单次尝试成本仅为人类专家的 1/30。
来源:Hacker News · AI · pzeroresearch.com