跳到正文
  1. Latent Space73

    Google DeepMind 发布 Gemini 4 Argon 模型,输出上限达 100 万 token

    Google DeepMind 发布了 Gemini 4 Argon 模型,专注于编码、企业知识工作和网络防御,并提供了 100 万 token 的输出上限。模型在 19 项可信基准测试中的 13 项取得领先,标准定价为每 100 万输入/输出 token 4/20 美元,目前通过 Fairwind 项目向政府用户和可信网络防御者提供有限预览。

    推荐理由:原文汇集了 Gemini 4 Argon 的发布详情、基准测试、定价和初步评测,读者可以了解其定位、能力与当前市场竞品的对比。

  2. 爱范儿64

    Gemini 4 Argon 正式发布,写作与长文本能力突出

    Gemini 4 Argon 正式发布,官方称其在写作、知识和长文本能力上领先,输出上限达 100 万 token,幻觉率降至 15%,API 定价为输入 2 美元/百万 token、输出 10 美元/百万 token。

    推荐理由:原文提供了 Gemini 4 Argon 的能力分布、输出上限和定价,读者可以据此判断其在写作与长文本任务中的相对优势和适用场景。

  3. Google DeepMind76

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,旨在处理复杂、长周期的跨领域工作流。该模型在 DeepSWE v1.1 上达到 77.9% 的 SOTA 水平,输出 token 上限提升至 100 万,定价为每百万输入 token 2 美元、输出 token 10 美元。

    推荐理由:原文详细列举了模型在软件工程、金融法律和网络安全等领域的性能表现及定价,读者可以据此评估其实际应用潜力。

  4. Google · Gemini 博客86

    Google 发布 Gemini 4 Argon 模型

    Google 发布 Gemini 4 Argon 模型,该模型在复杂软件工程、企业知识工作和网络安全防御中实现前沿性能,支持长达 100 万 token 的输出,已通过内部测试并面向受信任的网络安全团队逐步开放,定价为输入 token 每百万 2 美元,输出 token 每百万 10 美元。

    推荐理由:原文明确了模型在复杂任务中的性能跃升和安全防护机制,读者可据此评估其在实际工作流中的应用潜力。

  1. AI Business62

    Anthropic 发布 Claude Opus 5.5 模型

    Anthropic 发布了 Claude Opus 5.5 模型,擅长复杂的多步骤软件任务和知识密集型工作负载。其定价为每百万输入 token 4 美元、输出 token 20 美元,比 Opus 5 降价 20%,但仍高于同日发布的 OpenAI GPT-6 Sol 和 GPT-6 Luna。

    推荐理由:原文提供了新模型在编码任务上的具体性能数据、价格变化以及与竞品的详细对比,读者可以据此评估其性价比。

  1. Microsoft 新模型60

    Microsoft 发布 FrogNano-4B-2609 模型:基于 Qwen3.5-4B 的紧凑型代码智能体

    Microsoft 发布 FrogNano-4B-2609 模型,基于 Qwen/Qwen3.5-4B 架构,通过强化学习在约 1,500 个合成软件工程任务上训练,专用于仓库级代码智能体任务。

    推荐理由:原文详细说明了模型架构、训练方法、基准表现和使用限制,读者可据此判断其在代码智能体领域的定位与适用边界。

  1. 面壁 MiniCPM 新模型58

    面壁 MiniCPM5-2B 模型发布

    面壁 MiniCPM5-2B 模型发布,为2B参数量级的密集Transformer模型,支持131,072上下文长度,适用于本地部署和资源受限场景。模型在2B规模中达到开源SOTA,平均分53.9,优于多个4B模型,在代码、数学、长上下文、工具调用和智能体任务中表现突出。

    推荐理由:原文给出了模型参数、训练数据、评测基准和多芯片部署方案,读者可以据此判断它在2B规模模型中的性能定位和本地部署可行性。

  1. 智谱 GLM 新模型77

    智谱 GLM-5.3-BF16 模型发布,强化编码与智能体能力

    智谱发布 GLM-5.3-BF16 模型,基于 GLM-5.2 基座通过后训练提升能力,在编码、长链任务和智能体场景中表现显著增强。在 Z.ai Code Bench 上编码能力提升 50%,在 Terminal Bench 3.0、Agents' Last Exam、DeepSWE 等多个公开基准上达到开源模型 SOTA。

    推荐理由:原文提供了与前代模型的基准对比和本地部署方案,读者可据此判断其在编码和智能体任务中的实际能力提升与应用适配性。

  2. 智谱 GLM 新模型67

    智谱发布 GLM-5.3-Flash 多模态大模型

    智谱发布 GLM-5.3-Flash,为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 活跃参数,支持 300,000 token 上下文,采用混合稀疏与线性注意力架构及 mHC 技术,部署框架包括 SGLang、vLLM、TokenSpeed 等,可通过 reasoning_effort 参数控制推理预算,API 服务可在 Z.ai 平台使用。

    推荐理由:原文给出了模型参数、架构创新和部署框架,读者可以据此判断其在多模态和长上下文场景下的实际应用潜力。

  3. 智谱 GLM 新模型64

    智谱 GLM-5.3 发布:开源大模型在编码与智能体任务中取得显著提升

    智谱发布 GLM-5.3 模型,基于 GLM-5.2 的基础模型,通过后训练提升能力,在编码、长链任务和智能体基准上表现显著增强。在 Z.ai Code Bench 上编码能力提升 50%,在 Terminal Bench 3.0、Agents' Last Exam、CyberGym 等多个公开和内部基准中达到开源 SOTA。

    推荐理由:原文提供了与多个主流模型的基准对比数据和本地部署方案,读者可据此判断其在编码和智能体任务中的相对位置与可用性。

  1. 美团 LongCat 新模型59

    美团 LongCat 发布 LongCat-Flash-Lite-Sparse 模型,支持 1M 上下文和高效推理

    美团 LongCat 发布 LongCat-Flash-Lite-Sparse 模型,为非思考型 MoE 架构,总参数 69B,每 token 激活约 3B 参数,支持原生 1M 上下文。

    推荐理由:原文提供了模型架构、性能基准和部署指令,读者可据此判断其在长上下文和智能体任务中的实际可用性。

  1. 美团 LongCat 新模型66

    美团 LongCat-2.0 大模型发布:1.6T 参数、MoE 架构与长上下文能力

    美团发布 LongCat-2.0 大模型,总参数量达 1.6 万亿,激活参数约 480 亿,采用 MoE 架构与 LongCat Sparse Attention 技术,支持 1M 上下文训练,预训练覆盖超 35 万亿 token。

    推荐理由:原文给出了模型参数规模、架构创新和评测基准,读者可以据此判断其在长上下文和智能体任务中的实际能力边界。

  1. 美团 LongCat 新模型56

    美团 LongCat 发布 LongCat-2.0 大模型,支持 1M 上下文与智能体任务

    美团 LongCat 发布 LongCat-2.0,1.6 万亿参数 MoE 模型,激活参数约 480 亿/Token,支持 1M 上下文,引入 LongCat Sparse Attention 和 N-gram Embedding,提升长序列推理与编码能力。

    推荐理由:原文给出了模型参数规模、架构创新和评测基准,读者可以据此判断其在长上下文和智能体任务上的实际能力边界。

  1. Interconnects68

    GLM-5.2 是开放智能体模型的重要突破

    Z.ai 发布 GLM-5.2 模型,该模型在社区评测中表现优异,尤其在编码代理场景中与 OpenAI 和 Anthropic 的最新模型竞争,成为首个在实际使用中感觉‘正确’的开放权重通用智能体模型。

    推荐理由:原文基于实测和社区反馈,指出GLM-5.2在编码代理场景中达到与闭源模型相当的水平,对开放模型生态构成实质性影响。

  1. 智谱 GLM 新模型65

    智谱发布GLM-5.2大模型,支持1M上下文与多能力增强

    智谱发布GLM-5.2大模型,支持1M-token上下文,提升编码与推理能力,引入IndexShare架构降低计算开销,采用MIT开源许可。模型在HLE、AIME、SWE-bench等基准上表现领先,支持SGLang、vLLM等框架本地部署,提供API服务。

    推荐理由:原文提供了1M上下文、架构优化和开源许可等关键信息,读者可据此判断其在长上下文任务中的实际可用性与部署潜力。

  1. 月之暗面 Kimi 新模型75

    月之暗面发布 Kimi K3 大模型,支持 100 万 token 上下文与原生多模态

    月之暗面发布 Kimi K3 大模型,参数量 2.8T,支持 100 万 token 上下文窗口,具备原生多模态和智能体能力,采用 KDA 和 AttnRes 架构,开源权重并提供 API 接入。模型在 GPQA Diamond、DeepSWE、FrontierSWE 等多个基准上取得领先成绩,支持 MXFP4 量化,推荐在 vLLM、SGLang 等引擎上部署。

    推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长上下文、多模态和智能体任务中的实际能力边界。

  1. 月之暗面 Kimi 新模型73

    月之暗面 Kimi-K2.7-Code 模型发布

    月之暗面发布 Kimi-K2.7-Code,一款基于 Kimi K2.6 的编码专用智能体模型,采用 MoE 架构,参数量 1T,激活参数 32B,上下文长度 256K,支持图像与视频输入。

    推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长程编程任务和智能体场景中的实际能力与适用性。

  1. 月之暗面 Kimi 新模型73

    月之暗面发布 Kimi-K2.6 多模态智能体模型

    月之暗面发布 Kimi-K2.6,一个开源的原生多模态智能体模型,支持长上下文编码、编码驱动设计、智能体集群协作和主动自主执行。模型采用 MoE 架构,总参数 1T,激活参数 32B,上下文长度 256K,支持图像和视频输入。

    推荐理由:原文提供了模型架构、评测数据和部署方式,读者可以据此判断其在长上下文编码、智能体协作和多模态能力上的实际表现与适用场景。

  1. MiniMax 新模型71

    MiniMax 发布自进化模型 MiniMax-M2.7

    MiniMax 发布新模型 MiniMax-M2.7,支持模型自进化、复杂技能构建与多智能体协作,具备强工程能力,在 SWE-Pro、VIBE-Pro、GDPval-AA 等多个基准上表现优异,开源权重可于 HuggingFace 获取,推荐使用 SGLang、vLLM 或 Transformers 部署。

    推荐理由:模型支持自进化机制和多智能体协作,读者可依据其在多个工程与多模态基准上的表现评估其在复杂任务中的实际能力。