跳到正文
Hugging Face Blog·· 1 天前精选AI 评分62

Microsoft 与 Hugging Face 发布智能体评测基准 ThinkingBox

The Agent Said It Was Done. The Database Disagreed.

AI 导读

Microsoft 与 Hugging Face 联合发布智能体评测基准 ThinkingBox,通过检查数据库最终状态和副作用而非工具调用来评估智能体。该研究在 507 个有状态工作流上对 12 个 LLM 模型进行了 20 次重复测试,发现模型的一次性成功率(pass@1)与始终正确率(20/20)之间存在巨大差距。

推荐理由

该研究通过检查数据库最终状态而非工具调用来评估智能体,揭示了模型一次性成功与可靠执行之间的显著差距。

来源:Hugging Face Blog · huggingface.co