跳到正文
Ahead of AI· Sebastian Raschka, PhD·· 2025-12-30AI 评分34

2025 年大语言模型发展现状:推理能力、RLVR 和 GRPO 的突破

The State Of LLMs 2025: Progress, Problems, and Predictions

AI 导读

2025 年大语言模型领域持续发展,推理模型成为主流,DeepSeek R1 作为开源模型表现出与顶级闭源模型相当的性能,并引入 RLVR 和 GRPO 算法降低训练成本。训练 DeepSeek R1 的成本估计为 294,000 美元,远低于此前预期,但该数字仅涵盖计算资源费用,未包含研究人员薪资等其他成本。各大模型开发者均推出了基于推理的模型变体,推动了模型能力的扩展与优化。

来源:Ahead of AI · magazine.sebastianraschka.com