跳到正文
10月4日周日
  1. 钛媒体59

    StartLux 开源决策模型 StartLux-Decision,在多项基准测试中超越 Jev

    StartLux 开源了决策模型 StartLux-Decision,并一次性发布了 0.8B、2B、4B、9B、27B 五个参数版本。在 Decision Index 0.2.1 评测中,其 27B 版本得分 63.88,在 38 项基准中有 31 项高于 Jev 1.13;在另一套七项评测中平均准确率达 91.82%。

    推荐理由:原文提供了详细的基准测试对比和多种规格的量化版本,读者可以评估其在不同部署场景下的适用性。

  2. 极客公园62

    Tavus 发布实时交互模型 Griffin,近半数测试者未能分辨其为 AI

    美国 AI 视频公司 Tavus 发布实时交互模型 Griffin,在一项一分钟视频通话测试中,54 名参与者中有 26 人认为自己在和真人聊天。Griffin 采用端到端的全双工视频到视频架构,能实时生成语音、表情和手势,平均反应延迟为 0.43 秒。Tavus 表示该模型目前仅向少数受信任的测试者开放,并正在开发主动披露身份的安全功能。

    推荐理由:原文提供了模型的核心能力、技术架构和测试数据,读者可以据此评估其在实时交互领域的突破性。

10月2日周五
  1. CNET · AI46

    Gemini 4 Argon 发布:谷歌新 AI 模型何时可用

    谷歌发布了其最新的前沿模型 Gemini 4 Argon,但目前仅限特定网络安全专家通过 Fairwind 项目使用。该模型具备编码、多模态理解和推理能力,输出上限为 100 万 token,并声称在软件工程、网络安全及法律金融等知识工作领域表现优异。谷歌正遵循自愿审查流程,模型将先经专家测试修补,再逐步向订阅用户和免费用户开放。

10月1日周四
  1. Latent Space73

    Google DeepMind 发布 Gemini 4 Argon 模型,输出上限达 100 万 token

    Google DeepMind 发布了 Gemini 4 Argon 模型,专注于编码、企业知识工作和网络防御,并提供了 100 万 token 的输出上限。模型在 19 项可信基准测试中的 13 项取得领先,标准定价为每 100 万输入/输出 token 4/20 美元,目前通过 Fairwind 项目向政府用户和可信网络防御者提供有限预览。

    推荐理由:原文汇集了 Gemini 4 Argon 的发布详情、基准测试、定价和初步评测,读者可以了解其定位、能力与当前市场竞品的对比。

  2. Google DeepMind76

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,旨在处理复杂、长周期的跨领域工作流。该模型在 DeepSWE v1.1 上达到 77.9% 的 SOTA 水平,输出 token 上限提升至 100 万,定价为每百万输入 token 2 美元、输出 token 10 美元。

    推荐理由:原文详细列举了模型在软件工程、金融法律和网络安全等领域的性能表现及定价,读者可以据此评估其实际应用潜力。

9月30日周三
  1. 开源中国62

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,官方称其为一次重大升级,覆盖专业办公、操控电脑和 agentic 编程等任务。其智能水平接近 Astra,但价格仅为后者的五分之一。

9月29日周二
  1. 开源中国60

    Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 以上

    Anthropic 发布了 Claude Sonnet 5.5,定位为 Opus 5.5 的快速、低成本互补版本。官方称其速度比 Sonnet 5 快 30% 以上,多数任务成本低 30%,在 Agent 编程评测中成绩从 10% 跃升至 70%。

    推荐理由:原文给出了速度提升、成本降低和特定评测的进步幅度,读者可以据此判断它是否适合高频日常任务。

9月28日周一
9月23日周三
  1. AI Business62

    Anthropic 发布 Claude Opus 5.5 模型

    Anthropic 发布了 Claude Opus 5.5 模型,擅长复杂的多步骤软件任务和知识密集型工作负载。其定价为每百万输入 token 4 美元、输出 token 20 美元,比 Opus 5 降价 20%,但仍高于同日发布的 OpenAI GPT-6 Sol 和 GPT-6 Luna。

    推荐理由:原文提供了新模型在编码任务上的具体性能数据、价格变化以及与竞品的详细对比,读者可以据此评估其性价比。

  2. ZDNet · AI63

    Anthropic 发布 Claude Opus 5.5,性能对标 Fable 5.1 且成本降低 40%

    Anthropic 发布 Claude Opus 5.5,宣称其在多数工作上达到 Fable 5.1 的性能水平,且运行成本降低约 40%。模型输出速度比 Opus 5 快 30% 以上,token 价格降低 20%,订阅用户的 5 小时使用额度增加 20%。Anthropic 强调该模型在安全对齐方面有显著改进,并引入了针对网络安全和生物研究的验证程序。

    推荐理由:文章引用了多家企业客户的实际测试数据,为评估 Claude Opus 5.5 在成本、效率和安全性方面的提升提供了具体参考。

9月5日周六
  1. AI Business67

    OpenAI 发布 GPT-6 Astra,强调其安全性与计算机使用能力

    OpenAI 发布了专注于计算机使用和网络安全的 GPT-6 Astra 模型,称其为对齐程度最高的模型,能更好地理解用户意图和模型行为。该模型可以执行填写在线表格、更新 CRM 记录、组织日程、在线研究和起草邮件摘要等任务。

    推荐理由:原文提供了关于模型安全能力、潜在风险及行业趋势的第三方分析,有助于理解这类智能体的能力边界和竞争格局。

9月3日周四
8月28日周五
  1. fal 博客59

    fal 发布 H3 Max 视频生成模型

    fal 发布了 H3 Max,这是一个基于 MiniMax H3 进行后训练优化的视频生成模型,在人类偏好评估中,其在整体质量、提示词理解和美学三个维度均排名第一。该模型生成 5 秒视频的时间不到 3 秒,吞吐量约为官方 MiniMax H3 端点的 35 倍。H3 Max 现已上线 fal 平台,可通过 Playground、fal Agent 或 API 使用。

    推荐理由:原文展示了模型在质量和速度上的双重优势,并提供了与原始模型的对比数据,读者可以据此评估其实际应用潜力。

8月10日周一
  1. Ollama 博客57

    Meta Superintelligence Labs 的 Muse Glimmer 模型已在 Ollama 上线

    Meta Superintelligence Labs 发布的首个开源多模态模型 Muse Glimmer 现已可在 Ollama 上运行。这是一个 30B 参数、专为本地智能体工作负载设计的模型,拥有 128K+ 上下文长度,采用 Apache 2.0 许可证。

    推荐理由:原文提供了模型参数、许可证、支持的智能体框架和性能优化细节,读者可以据此评估其本地部署的适用性。