Hugging Face · 每日论文·· 2 天前精选AI 评分62
MiMo-V2.6:通过扩展强化学习实现模型自改进
MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement
AI 导读
MiMo-V2.6 系列通过扩展强化学习计算推动模型自改进,涵盖更大批次、更复杂环境和更精准奖励信号,支持上下文长度达1M,开源训练动态、环境和框架以促进复现。
推荐理由
原文公开了训练动态、环境和框架,研究者可据此复现大规模强化学习的自改进路径。
来源:Hugging Face · 每日论文 · huggingface.co