Vercel AI Gateway 2026年9月生产指数:开源模型处理56%的token量,Astra支出是Fable 5.1的两倍
Vercel AI Gateway 2026年9月生产指数显示,8月开源模型首次处理了网关56%的token量,而2025年12月这一比例还不到10%。平均token价格连续第三个月下降,8月环比下降23.2%。
推荐理由:基于网关生产数据的月度分析,揭示了开源模型在用量上首次反超闭源模型、以及用户在不同模型间迁移的成本驱动模式。
Vercel AI Gateway 2026年9月生产指数显示,8月开源模型首次处理了网关56%的token量,而2025年12月这一比例还不到10%。平均token价格连续第三个月下降,8月环比下降23.2%。
推荐理由:基于网关生产数据的月度分析,揭示了开源模型在用量上首次反超闭源模型、以及用户在不同模型间迁移的成本驱动模式。
NVIDIA 推出 DeepSeek-V4.1-Flash-NVFP4 模型,该模型基于 DeepSeek-V4.1-Flash 进行量化,支持上下文长度达 1M tokens。
DeepSeek发布多模态Mixture-of-Experts模型DeepSeek-V4.1-Flash,拥有552B参数,支持最多100万token上下文。模型采用CED架构,通过SWA Bounded Replay和CSA2技术将全局KV缓存降至890字节/token,约为前代的1/4。
推荐理由:模型在KV缓存压缩和多模态能力上实现突破,支持百万token上下文和可调推理努力,对长上下文智能体应用有直接价值。
DeepSeek 发布 DeepSeek-V4-Flash-Vision-Exp,基于 DeepSeek-V4-Flash 架构加入视觉模块并持续训练,提升多模态智能体能力。
Together AI 在软件工程基准 DeepSWE 上对比了 DeepSeek V4 Pro 0813 与 Claude Fable 5。Claude Fable 5 单次尝试准确率更高(69.7% vs 62.8%),但成本是前者的 90 倍(每次尝试 $21.63 vs $0.24)。
推荐理由:原文通过详细的成本、准确率和任务类型对比,为开发者选择模型提供了具体的决策依据。
DeepSeek-V4-Flash-0731 正式发布,取代预览版,具备增强的智能体能力,模型结构包含 DSpark 推理加速模块。在 Terminal Bench、NL2Repo、Cybergym 等多个基准上表现优于 DeepSeek-V4-Pro(预览版),且激活参数更少。
推荐理由:该模型在多个基准上超越了预览版,且参数激活量更小,读者可依据其推理能力与部署方式判断其在智能体场景中的适用性。
DeepSeek 推出 eagle3_gemma4_12b_ttt7 模型,参数规模为 2B,支持 BF16 精度。该模型未被任何推理服务提供商部署,用户可自行通过 Space 使用。模型属于 DeepSpec 集合,包含 12 个项目,最近一次更新时间为 6 月 28 日。
GPT-5.5 在长上下文编码任务中以 50.7% 的正确率领先 DeepSeek V4 的 26.0%。测试基于 25 道编程题的 CodeContests 数据集,每道题独立评分。结果通过 Weights & Biases Weave 进行了记录和分析。
DeepSeek-V4 通过压缩 KV 缓存的 token 维度来支持百万 token 上下文,但这将压力转移到了推理系统。模型采用混合注意力设计,包括压缩稀疏注意力、重度压缩注意力和滑动窗口注意力,这要求推理引擎同时管理三种具有不同大小和生命周期的缓存对象。文章基于在 NVIDIA HGX B200 上的早期部署经验,分析了缓存策略、前缀复用和不同工作负载下的性能权衡。
推荐理由:文章从推理系统角度剖析了 DeepSeek-V4 百万 token 上下文窗口的实现挑战,为开发者评估其实际部署成本提供了具体的技术视角。
Together AI 宣布其 AI Native Cloud 平台上线 DeepSeek-V4 Pro 模型,提供 Serverless Inference 和 Dedicated Endpoints 两种部署方式。
推荐理由:原文给出了模型在平台上的部署细节、定价模式和推理模式选择,读者可以据此判断它如何适配不同复杂度的长上下文任务。