跳到正文
Weights & Biases· Shreyan Basu Ray·· 2026-07-11AI 评分45

GLM-5.2:将批评者纳入基于PPO的训练的开源编码模型

GLM-5.2: The open coding model that put the critic back into RL

AI 导读

智谱推出 GLM-5.2,采用基于批评者的 PPO 训练方法,结合 DeepSeek 稀疏注意力机制提升编码能力。模型在 W&B Weave 上展示了实时智能体编码演示,强调训练过程的可追踪性。该模型为开源,适用于需要高精度代码生成与优化的开发者和研究者。

来源:Weights & Biases · wandb.ai