Hacker News · AI· nickcosta·· 1 小时前精选AI 评分70
实测8个AI智能体是否遵守隐藏信息指令:4个始终遵守,4个完全无视
I tested whether AI agents obey text you never see. 4 of 8 did, every time
AI 导读
作者测试了13个模型在工具描述中添加隐藏信息指令时的行为,8个可评分模型中4个(Qwen3 4B、Qwen3 14B、Minstral 8B、Gemma 4)在所有运行中均未向用户透露内部参考号,4个(Claude Haiku/Sonnet/Fable、Granite 4.0 Tiny)则始终泄露。
推荐理由
作者通过实测发现部分模型能严格遵循工具描述中隐藏信息的指令,但效果因模型而异,且不同指令类型影响结果,这对构建可信AI系统有参考价值。
来源:Hacker News · AI · smallprint.dev