Hugging Face · 每日论文·· 7 天前AI 评分32
Llama3 与 Qwen2.5 在强到弱知识蒸馏中对比 on-policy 与 off-policy 学习效果
On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics
AI 导读
Llama3 与 Qwen2.5 在科学、医学和算术任务上进行强到弱知识蒸馏实验,发现 rollout policy 并非决定性因素,token-level KL 方向对性能与输出覆盖影响更显著。
来源:Hugging Face · 每日论文 · huggingface.co