Hacker News · AI· Betelbuddy·· 2 小时前AI 评分50
TasteVal:评估前沿模型实验研究品味的基准
Measuring the Experimental Research Taste of AI Systems Against Human Experts
AI 导读
TasteVal 基准测试引入了 Opus 5.5 模型,其计算效率乘数达到 2.3x,成本仅为人类专家平均值的 1/30。该基准包含 8 个新颖且开放的任务,用于衡量模型在固定研究问题下设计实验和得出结论的能力。自 2025 年 12 月以来,前沿模型的计算效率乘数每 3.0 个月翻倍一次,而最终标准化性能每 14.6 个月翻倍一次。
来源:Hacker News · AI · arxiv.org