跳到正文
Hugging Face · 每日论文·· 4 天前AI 评分50

Keyword 检测揭示小语言模型工具调用虚假正例:低成本诊断链可区分真实与幻觉能力

Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Models

AI 导读

661.6M 参数模型在工具调用任务中得分0.660,而1,109M参数模型(经6B token工具微调)得分0.650,但前者在训练样本上可正确生成工具调用。

来源:Hugging Face · 每日论文 · huggingface.co