跳到正文
Hugging Face · 每日论文·· 6 天前AI 评分38

On-Policy 参数更新方向是 LLM 后训练泛化性能的关键

On-Policy Parameter Update Direction Underlies Generalization in LLM Post-Training

AI 导读

研究发现,On-Policy 后训练范式的泛化优势源于其参数更新方向,并据此提出了 On-Policy 方向约束的监督微调方法 OPSFT。OPSFT 将 SFT 的更新约束在 On-Policy 范式识别出的方向上,从而将后者的强泛化能力转移给 SFT。该方法结合了 On-Policy 的泛化优势与 SFT 的高训练效率及利用高质量轨迹的能力。

来源:Hugging Face · 每日论文 · huggingface.co