Hugging Face · 每日论文·· 2 天前AI 评分27
MARGIN:多智能体基础模型协调的运行时置信度校准方法
MARGIN: Runtime Confidence Calibration for Multi-Agent Foundation Model Coordination
AI 导读
MARGIN 是一种多智能体基础模型协调的运行时置信度校准方法,通过观察答案结果学习模型特定的置信度修正,无需重新训练模型或额外校准数据集。在 BigCodeBench 上,模型的平均置信度与准确性呈负相关,选择更自信的响应者在正确/错误对中表现低于随机;与五种在线校准基线相比,MARGIN 在两个代码生成任务中校准后预期校准误差更低。
来源:Hugging Face · 每日论文 · huggingface.co