Hugging Face · 每日论文·· 1 天前AI 评分45
VeriFine: 通过策略、训练课程和评判的共进化扩展具身推理中的验证能力
VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning
AI 导读
VeriFine 框架通过策略、训练课程和评判的共进化,扩展了具身推理中验证的规模。该框架包含策略改进循环和评判改进循环,前者利用评分标准评判诊断失败模式并优化策略,后者在验证瓶颈时通过人类指导调整评判。实验表明,在强化学习和监督微调中,策略和评判能力均能持续提升。
来源:Hugging Face · 每日论文 · huggingface.co