跳到正文
Hacker News · AI· nickcosta·· 1 小时前精选AI 评分70

实测8个AI智能体是否遵守隐藏信息指令:4个始终遵守,4个完全无视

I tested whether AI agents obey text you never see. 4 of 8 did, every time

AI 导读

作者测试了13个模型在工具描述中添加隐藏信息指令时的行为,8个可评分模型中4个(Qwen3 4B、Qwen3 14B、Minstral 8B、Gemma 4)在所有运行中均未向用户透露内部参考号,4个(Claude Haiku/Sonnet/Fable、Granite 4.0 Tiny)则始终泄露。

推荐理由

作者通过实测发现部分模型能严格遵循工具描述中隐藏信息的指令,但效果因模型而异,且不同指令类型影响结果,这对构建可信AI系统有参考价值。

来源:Hacker News · AI · smallprint.dev