跳到正文
10月4日周日
  1. 钛媒体59

    StartLux 开源决策模型 StartLux-Decision,在多项基准测试中超越 Jev

    StartLux 开源了决策模型 StartLux-Decision,并一次性发布了 0.8B、2B、4B、9B、27B 五个参数版本。在 Decision Index 0.2.1 评测中,其 27B 版本得分 63.88,在 38 项基准中有 31 项高于 Jev 1.13;在另一套七项评测中平均准确率达 91.82%。

    推荐理由:原文提供了详细的基准测试对比和多种规格的量化版本,读者可以评估其在不同部署场景下的适用性。

10月1日周四
  1. Latent Space73

    Google DeepMind 发布 Gemini 4 Argon 模型,输出上限达 100 万 token

    Google DeepMind 发布了 Gemini 4 Argon 模型,专注于编码、企业知识工作和网络防御,并提供了 100 万 token 的输出上限。模型在 19 项可信基准测试中的 13 项取得领先,标准定价为每 100 万输入/输出 token 4/20 美元,目前通过 Fairwind 项目向政府用户和可信网络防御者提供有限预览。

    推荐理由:原文汇集了 Gemini 4 Argon 的发布详情、基准测试、定价和初步评测,读者可以了解其定位、能力与当前市场竞品的对比。

  2. Google DeepMind76

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,旨在处理复杂、长周期的跨领域工作流。该模型在 DeepSWE v1.1 上达到 77.9% 的 SOTA 水平,输出 token 上限提升至 100 万,定价为每百万输入 token 2 美元、输出 token 10 美元。

    推荐理由:原文详细列举了模型在软件工程、金融法律和网络安全等领域的性能表现及定价,读者可以据此评估其实际应用潜力。

  3. Google · Gemini 博客86

    Google 发布 Gemini 4 Argon 模型

    Google 发布 Gemini 4 Argon 模型,该模型在复杂软件工程、企业知识工作和网络安全防御中实现前沿性能,支持长达 100 万 token 的输出,已通过内部测试并面向受信任的网络安全团队逐步开放,定价为输入 token 每百万 2 美元,输出 token 每百万 10 美元。

    推荐理由:原文明确了模型在复杂任务中的性能跃升和安全防护机制,读者可据此评估其在实际工作流中的应用潜力。

9月23日周三
  1. AI Business62

    Anthropic 发布 Claude Opus 5.5 模型

    Anthropic 发布了 Claude Opus 5.5 模型,擅长复杂的多步骤软件任务和知识密集型工作负载。其定价为每百万输入 token 4 美元、输出 token 20 美元,比 Opus 5 降价 20%,但仍高于同日发布的 OpenAI GPT-6 Sol 和 GPT-6 Luna。

    推荐理由:原文提供了新模型在编码任务上的具体性能数据、价格变化以及与竞品的详细对比,读者可以据此评估其性价比。

  2. ZDNet · AI63

    Anthropic 发布 Claude Opus 5.5,性能对标 Fable 5.1 且成本降低 40%

    Anthropic 发布 Claude Opus 5.5,宣称其在多数工作上达到 Fable 5.1 的性能水平,且运行成本降低约 40%。模型输出速度比 Opus 5 快 30% 以上,token 价格降低 20%,订阅用户的 5 小时使用额度增加 20%。Anthropic 强调该模型在安全对齐方面有显著改进,并引入了针对网络安全和生物研究的验证程序。

    推荐理由:文章引用了多家企业客户的实际测试数据,为评估 Claude Opus 5.5 在成本、效率和安全性方面的提升提供了具体参考。

9月5日周六
  1. AI Business67

    OpenAI 发布 GPT-6 Astra,强调其安全性与计算机使用能力

    OpenAI 发布了专注于计算机使用和网络安全的 GPT-6 Astra 模型,称其为对齐程度最高的模型,能更好地理解用户意图和模型行为。该模型可以执行填写在线表格、更新 CRM 记录、组织日程、在线研究和起草邮件摘要等任务。

    推荐理由:原文提供了关于模型安全能力、潜在风险及行业趋势的第三方分析,有助于理解这类智能体的能力边界和竞争格局。

9月3日周四
5月29日周五