Hugging Face · 每日论文·· 4 天前AI 评分50
Keyword 检测揭示小语言模型工具调用虚假正例:低成本诊断链可区分真实与幻觉能力
Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Models
AI 导读
661.6M 参数模型在工具调用任务中得分0.660,而1,109M参数模型(经6B token工具微调)得分0.650,但前者在训练样本上可正确生成工具调用。
来源:Hugging Face · 每日论文 · huggingface.co