跳到正文
Hugging Face · 每日论文·· 2 天前精选AI 评分62

MiMo-V2.6:通过扩展强化学习实现模型自改进

MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

AI 导读

MiMo-V2.6 系列通过扩展强化学习计算推动模型自改进,涵盖更大批次、更复杂环境和更精准奖励信号,支持上下文长度达1M,开源训练动态、环境和框架以促进复现。

推荐理由

原文公开了训练动态、环境和框架,研究者可据此复现大规模强化学习的自改进路径。

来源:Hugging Face · 每日论文 · huggingface.co