跳到正文
Hacker News · AI· giuliomagnifico·· 1 天前AI 评分37

研究:发现让 AI 模型标记可疑答案的路径

Study: Path discovered to make AI models red-flag their doubtful answers

AI 导读

UC Riverside 研究团队发现,大语言模型中的不确定性和正确性由不同的内部特征驱动,这挑战了模型自信度与答案准确性相关的假设。通过使用稀疏自编码器工具,他们识别出三类特征,并在不重新训练模型的前提下,通过抑制部分特征使模型准确率提升最高达 1.1%,同时减少不确定性达 75%。研究还表明,这些特征可应用于不同问答基准,为开发者提供了一种提升 AI 可靠性的实用方法。

来源:Hacker News · AI · news.ucr.edu