跳到正文
Hugging Face · 每日论文·· 1 天前精选AI 评分60

研究揭示工具使用智能体在证据到行动链条中的失败模式

From Evidence to Action: How Tool-Using Agents Fail

AI 导读

研究分析工具使用智能体在从证据到行动链条中的失败模式,发现即使静态评估表现强,交互执行仍可能弱,尤其在多步工作流中存在未解决前提和执行不完整问题。研究引入 SafeActBench 基准,包含 656 个案例,覆盖六类操作领域和五种协议,通过证据日志和确定性轨迹评估器追踪信息建立、动作发生及依赖满足情况,指出失败不仅源于信息缺失,也源于对已有证据的使用方式。

推荐理由

研究揭示了工具使用智能体在证据到行动链条中的断裂点,尤其在多步工作流中暴露的依赖缺失问题,为安全对齐提供可验证评估框架。

来源:Hugging Face · 每日论文 · huggingface.co