跳到正文
Hugging Face · 每日论文·· 7 天前AI 评分32

Llama3 与 Qwen2.5 在强到弱知识蒸馏中对比 on-policy 与 off-policy 学习效果

On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

AI 导读

Llama3 与 Qwen2.5 在科学、医学和算术任务上进行强到弱知识蒸馏实验,发现 rollout policy 并非决定性因素,token-level KL 方向对性能与输出覆盖影响更显著。

来源:Hugging Face · 每日论文 · huggingface.co