跳到正文
热点事件持续更新

TasteVal基准称AI模型实验研究品味快速提升

2 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

PZero Research发布TasteVal基准,称自2025年12月以来,前沿AI模型的实验研究品味(以实验计算效率衡量)每3.0个月翻倍,且Opus 5.5模型的实验计算效率是人类的2.30倍,成本仅为1/30。 该基准用于评估AI模型在AI研发任务中的实验设计能力,包含8个开放任务。

AI 根据报道生成 · 53 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. Hacker News · AI
    TasteVal:评估前沿模型实验研究品味的基准

    TasteVal 基准测试引入了 Opus 5.5 模型,其计算效率乘数达到 2.3x,成本仅为人类专家平均值的 1/30。该基准包含 8 个新颖且开放的任务,用于衡量模型在固定研究问题下设计实验和得出结论的能力。自 2025 年 12 月以来,前沿模型的计算效率乘数每 3.0 个月翻倍一次,而最终标准化性能每 14.6 个月翻倍一次。

10月6日
  1. Hacker News · AI
    TasteVal:评估 AI 在 AI 研究任务中的实验研究品味

    TasteVal 是一个用于评估 AI 模型在 AI 研究任务中实验设计能力的基准,其核心指标是实验计算效率。自 2025 年 12 月起,前沿模型的实验研究品味每 3.0 个月翻倍(95% 置信区间 1.7-5.0 个月)。Opus 5.5 在实验计算效率上达到人类专家的 2.30 倍(95% 置信区间 1.15-4.37 倍),且单次尝试成本仅为人类专家的 1/30。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。