跳到正文
  1. Vercel 博客62

    Vercel AI Gateway 2026年9月生产指数:开源模型处理56%的token量,Astra支出是Fable 5.1的两倍

    Vercel AI Gateway 2026年9月生产指数显示,8月开源模型首次处理了网关56%的token量,而2025年12月这一比例还不到10%。平均token价格连续第三个月下降,8月环比下降23.2%。

    推荐理由:基于网关生产数据的月度分析,揭示了开源模型在用量上首次反超闭源模型、以及用户在不同模型间迁移的成本驱动模式。

  1. DeepSeek 新模型75

    DeepSeek发布多模态MoE模型DeepSeek-V4.1-Flash,支持百万token上下文与可调推理努力

    DeepSeek发布多模态Mixture-of-Experts模型DeepSeek-V4.1-Flash,拥有552B参数,支持最多100万token上下文。模型采用CED架构,通过SWA Bounded Replay和CSA2技术将全局KV缓存降至890字节/token,约为前代的1/4。

    推荐理由:模型在KV缓存压缩和多模态能力上实现突破,支持百万token上下文和可调推理努力,对长上下文智能体应用有直接价值。

  1. Together AI72

    Together AI 评测:DeepSeek V4 Pro 0813 与 Claude Fable 5 在 DeepSWE 上的成本与性能对比

    Together AI 在软件工程基准 DeepSWE 上对比了 DeepSeek V4 Pro 0813 与 Claude Fable 5。Claude Fable 5 单次尝试准确率更高(69.7% vs 62.8%),但成本是前者的 90 倍(每次尝试 $21.63 vs $0.24)。

    推荐理由:原文通过详细的成本、准确率和任务类型对比,为开发者选择模型提供了具体的决策依据。

  1. DeepSeek 新模型71

    DeepSeek-V4-Pro-0813 模型正式发布,增强智能体能力与推理性能

    DeepSeek-V4-Pro-0813 正式发布,取代预览版,集成 DSpark 推理加速模块,在 HLE、Terminal Bench、DeepSWE 等多个基准上表现提升,尤其在生产环境和智能体任务中显著增强。

    推荐理由:原文提供了性能对比数据、推理参数和部署方案,读者可据此评估其在生产环境中的实际应用潜力。

  1. DeepSeek 新模型66

    DeepSeek-V4-Flash-0731 模型正式发布,增强智能体能力并支持 DSpark 推理加速

    DeepSeek-V4-Flash-0731 正式发布,取代预览版,具备增强的智能体能力,模型结构包含 DSpark 推理加速模块。在 Terminal Bench、NL2Repo、Cybergym 等多个基准上表现优于 DeepSeek-V4-Pro(预览版),且激活参数更少。

    推荐理由:该模型在多个基准上超越了预览版,且参数激活量更小,读者可依据其推理能力与部署方式判断其在智能体场景中的适用性。

  1. Together AI73

    Together AI 解析服务 DeepSeek-V4:为何百万 token 上下文是推理系统问题

    DeepSeek-V4 通过压缩 KV 缓存的 token 维度来支持百万 token 上下文,但这将压力转移到了推理系统。模型采用混合注意力设计,包括压缩稀疏注意力、重度压缩注意力和滑动窗口注意力,这要求推理引擎同时管理三种具有不同大小和生命周期的缓存对象。文章基于在 NVIDIA HGX B200 上的早期部署经验,分析了缓存策略、前缀复用和不同工作负载下的性能权衡。

    推荐理由:文章从推理系统角度剖析了 DeepSeek-V4 百万 token 上下文窗口的实现挑战,为开发者评估其实际部署成本提供了具体的技术视角。

  1. Together AI58

    DeepSeek-V4 Pro 现已在 Together AI 平台上线

    Together AI 宣布其 AI Native Cloud 平台上线 DeepSeek-V4 Pro 模型,提供 Serverless Inference 和 Dedicated Endpoints 两种部署方式。

    推荐理由:原文给出了模型在平台上的部署细节、定价模式和推理模式选择,读者可以据此判断它如何适配不同复杂度的长上下文任务。

已经到底了