Hugging Face · 每日论文·· 4 天前AI 评分38
DiVeR: Decision-Critical Verifier Learning for VLA Test-Time Scaling
DiVeR: Decision-Critical Verifier Learning for VLA Test-Time Scaling
AI 导读
DiVeR 提出了一种基于决策关键性的验证器学习方法,用于在推理时更有效地进行 Vision-Language-Action(VLA)策略的扩展。该方法通过估计采样动作表示的分散程度,重新加权验证器学习,聚焦于对动作选择影响最大的状态,无需额外的环境交互或步骤级标注。
来源:Hugging Face · 每日论文 · huggingface.co