跳到正文
DeepSeek 新模型·· 25 天前精选AI 评分75

DeepSeek发布多模态MoE模型DeepSeek-V4.1-Flash,支持百万token上下文与可调推理努力

deepseek-ai/DeepSeek-V4.1-Flash

AI 导读

DeepSeek发布多模态Mixture-of-Experts模型DeepSeek-V4.1-Flash,拥有552B参数,支持最多100万token上下文。模型采用CED架构,通过SWA Bounded Replay和CSA2技术将全局KV缓存降至890字节/token,约为前代的1/4。

推荐理由

模型在KV缓存压缩和多模态能力上实现突破,支持百万token上下文和可调推理努力,对长上下文智能体应用有直接价值。

来源:DeepSeek 新模型 · huggingface.co