Ahead of AI· Sebastian Raschka, PhD·· 2025-12-03AI 评分49
从 DeepSeek V3 到 V3.2:架构、稀疏注意力与强化学习更新
From DeepSeek V3 to V3.2: Architecture, Sparse Attention, and RL Updates
AI 导读
DeepSeek V3.2 发布,采用非标准稀疏注意力机制,性能在 GPT-5 和 Gemini 3.0 Pro 上表现优异,且作为开源模型提供。该模型基于与 V3 相同的架构,但引入了新的推理优化,与 DeepSeek R1 等专用推理模型形成对比。DeepSeek 团队今年还发布了 V3.1 和 V3.2-Exp,为 V3.2 的部署做好了生态和推理基础设施准备。
来源:Ahead of AI · magazine.sebastianraschka.com