Hugging Face · 每日论文·· 3 天前AI 评分34
MetaRubric:基于量规的强化学习奖励学习框架
MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning
AI 导读
MetaRubric 通过证据感知的策略优化与响应引导的量规适应交替进行,解决了基于量规的强化学习中的“空洞奖励”问题。该方法要求响应包含足够证据才能获得相应量规标准的分数,并在 PubMedQA 上比静态评判的 GRPO 准确率提升了 6.00 至 20.40 个百分点。
来源:Hugging Face · 每日论文 · huggingface.co