Alignment Forum· camilablank·· 12 天前AI 评分33
WorkspaceBench:评估激活到文本工具对模型全局工作区的解读能力
WorkspaceBench: Evaluating Interpretability Methods for the Global Workspace
AI 导读
WorkspaceBench 是一个用于评估激活到文本工具能否准确读取模型“全局工作区”内容的基准,包含 3,356 道题覆盖 27 个评估类别,重点测试模型中间变量的解读能力与幻觉控制。该基准专为 Qwen-3.6-27B 开发,预计适用于更大模型,但可能需要调整以适配较小或较弱模型。基准旨在识别具备多 token 解码能力的 J-lens 工具,已开源。
来源:Alignment Forum · alignmentforum.org