跳到正文
Hugging Face · 每日论文·· 2 天前AI 评分37

Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability

Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability

AI 导读

本文探讨了跨分词器的 On-Policy Distillation(OPD)方法,发现即使在词汇不匹配的情况下,严格对齐的 1:1 分词组已能覆盖大部分学生模型生成的 token。

来源:Hugging Face · 每日论文 · huggingface.co