跳到正文
Amazon Science·· 2026-08-27AI 评分40

当大语言模型作为评判者时,如何判断它们的意见是否独立?

When LLM judges agree, should we believe them?

AI 导读

本文提出一种基于 Ising 模型的依赖感知标签聚合方法,用于评估多个大语言模型作为评判者时输出的相关性,并据此调整综合评分。该方法在三个二分类任务中,相比加权多数投票和均匀多数投票基线,准确率分别提升了 9% 到 14%。该方法适用于无监督场景,从评判者输出中学习模型技能和相似性,无需依赖人工标注的参考标签。

来源:Amazon Science · amazon.science