跳到正文
Hugging Face · 每日论文·· 1 天前AI 评分45

VeriFine: 通过策略、训练课程和评判的共进化扩展具身推理中的验证能力

VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning

AI 导读

VeriFine 框架通过策略、训练课程和评判的共进化,扩展了具身推理中验证的规模。该框架包含策略改进循环和评判改进循环,前者利用评分标准评判诊断失败模式并优化策略,后者在验证瓶颈时通过人类指导调整评判。实验表明,在强化学习和监督微调中,策略和评判能力均能持续提升。

来源:Hugging Face · 每日论文 · huggingface.co