跳到正文
  1. DeepSeek 新模型75

    DeepSeek发布多模态MoE模型DeepSeek-V4.1-Flash,支持百万token上下文与可调推理努力

    DeepSeek发布多模态Mixture-of-Experts模型DeepSeek-V4.1-Flash,拥有552B参数,支持最多100万token上下文。模型采用CED架构,通过SWA Bounded Replay和CSA2技术将全局KV缓存降至890字节/token,约为前代的1/4。

    推荐理由:模型在KV缓存压缩和多模态能力上实现突破,支持百万token上下文和可调推理努力,对长上下文智能体应用有直接价值。

  1. DeepSeek 新模型71

    DeepSeek-V4-Pro-0813 模型正式发布,增强智能体能力与推理性能

    DeepSeek-V4-Pro-0813 正式发布,取代预览版,集成 DSpark 推理加速模块,在 HLE、Terminal Bench、DeepSWE 等多个基准上表现提升,尤其在生产环境和智能体任务中显著增强。

    推荐理由:原文提供了性能对比数据、推理参数和部署方案,读者可据此评估其在生产环境中的实际应用潜力。

  1. DeepSeek 新模型66

    DeepSeek-V4-Flash-0731 模型正式发布,增强智能体能力并支持 DSpark 推理加速

    DeepSeek-V4-Flash-0731 正式发布,取代预览版,具备增强的智能体能力,模型结构包含 DSpark 推理加速模块。在 Terminal Bench、NL2Repo、Cybergym 等多个基准上表现优于 DeepSeek-V4-Pro(预览版),且激活参数更少。

    推荐理由:该模型在多个基准上超越了预览版,且参数激活量更小,读者可依据其推理能力与部署方式判断其在智能体场景中的适用性。

已经到底了