跳到正文
Hugging Face · 每日论文·· 4 天前AI 评分38

DiVeR: Decision-Critical Verifier Learning for VLA Test-Time Scaling

DiVeR: Decision-Critical Verifier Learning for VLA Test-Time Scaling

AI 导读

DiVeR 提出了一种基于决策关键性的验证器学习方法,用于在推理时更有效地进行 Vision-Language-Action(VLA)策略的扩展。该方法通过估计采样动作表示的分散程度,重新加权验证器学习,聚焦于对动作选择影响最大的状态,无需额外的环境交互或步骤级标注。

来源:Hugging Face · 每日论文 · huggingface.co