跳到正文
今天10月5日周一2 条
  1. IT之家62

    TypeSafe AI 决策模型 Jev 日处理量达 1 万亿 Token,硅谷巨头火速跟进复刻

    初创公司 TypeSafe AI 发布了决策模型 Jev,其通过强化学习将输入归类到预设输出,而非生成文本,日处理量已达 1 万亿 token。OpenAI、Databricks、Cloudflare 和亚马逊等公司近期也推出了类似功能的工具或模型,形成了一个与生成式模型互补的决策模型新类别。

    推荐理由:原文梳理了决策模型的技术路线和多家公司的跟进动作,读者可以了解这一新兴类别如何与生成式模型形成互补。

  2. MarkTechPost73

    GPT-6 Astra、GPT-6.1 Sol、Gemini 4 Argon 与 Claude Fable 5.1:如何根据任务选择前沿模型

    文章对比了 OpenAI、Google DeepMind 和 Anthropic 在 30 天内发布的四款前沿模型。GPT-6.1 Sol 在 DeepSWE v1.1 等基准上表现接近 GPT-6 Astra,但价格仅为五分之一。

    推荐理由:原文对比了四款前沿模型在价格、访问规则和不同任务上的表现差异,为读者选择模型提供了具体的工作负载匹配建议。

10月4日周日
  1. 钛媒体59

    StartLux 开源决策模型 StartLux-Decision,在多项基准测试中超越 Jev

    StartLux 开源了决策模型 StartLux-Decision,并一次性发布了 0.8B、2B、4B、9B、27B 五个参数版本。在 Decision Index 0.2.1 评测中,其 27B 版本得分 63.88,在 38 项基准中有 31 项高于 Jev 1.13;在另一套七项评测中平均准确率达 91.82%。

    推荐理由:原文提供了详细的基准测试对比和多种规格的量化版本,读者可以评估其在不同部署场景下的适用性。

  2. 极客公园62

    Tavus 发布实时交互模型 Griffin,近半数测试者未能分辨其为 AI

    美国 AI 视频公司 Tavus 发布实时交互模型 Griffin,在一项一分钟视频通话测试中,54 名参与者中有 26 人认为自己在和真人聊天。Griffin 采用端到端的全双工视频到视频架构,能实时生成语音、表情和手势,平均反应延迟为 0.43 秒。Tavus 表示该模型目前仅向少数受信任的测试者开放,并正在开发主动披露身份的安全功能。

    推荐理由:原文提供了模型的核心能力、技术架构和测试数据,读者可以据此评估其在实时交互领域的突破性。

  3. 钛媒体23

    【数智周报】中国大模型首次进入OpenAI企业付费结算体系;AMD斥资82亿美元收购李飞飞世界模型公司;Anthropic上市文件披露对亚马逊、谷歌依赖加深,2025年营收近46亿美元……

    Kimi K3通过美国AI基础设施公司Baseten进入OpenAI企业付费结算体系,企业用户调用费用可直接计入其OpenAI采购额度。这是中国开源模型首次进入该主流企业采购通道。同期,Anthropic提交的IPO文件显示其2025年营收达45.9亿美元,其中近半数依赖亚马逊和谷歌云平台。

10月3日周六
  1. MarkTechPost64

    决策 AI 模型解析:TypeSafe Jev 与 Fastino GLiDE、GLiNER2.5-Decide 及开源竞品对比

    决策 AI 模型是一种返回带概率的决策而非生成文本的新模型类别,适用于分类、路由、评分等需要确定性答案的场景。TypeSafe AI 的 Jev 是该领域的代表,定价为每百万输入 token 0.042 美元,输出免费;Fastino Labs 随后推出了竞品 GLiDE 和开源模型 GLiNER2.5-Decide,同时社区也出现了多个开源复现项目。

    推荐理由:文章对比了多款决策模型的核心能力、定价和适用场景,为开发者选择工具提供了具体参考。

10月2日周五
  1. CNET · AI46

    Gemini 4 Argon 发布:谷歌新 AI 模型何时可用

    谷歌发布了其最新的前沿模型 Gemini 4 Argon,但目前仅限特定网络安全专家通过 Fairwind 项目使用。该模型具备编码、多模态理解和推理能力,输出上限为 100 万 token,并声称在软件工程、网络安全及法律金融等知识工作领域表现优异。谷歌正遵循自愿审查流程,模型将先经专家测试修补,再逐步向订阅用户和免费用户开放。

10月1日周四
  1. Latent Space73

    Google DeepMind 发布 Gemini 4 Argon 模型,输出上限达 100 万 token

    Google DeepMind 发布了 Gemini 4 Argon 模型,专注于编码、企业知识工作和网络防御,并提供了 100 万 token 的输出上限。模型在 19 项可信基准测试中的 13 项取得领先,标准定价为每 100 万输入/输出 token 4/20 美元,目前通过 Fairwind 项目向政府用户和可信网络防御者提供有限预览。

    推荐理由:原文汇集了 Gemini 4 Argon 的发布详情、基准测试、定价和初步评测,读者可以了解其定位、能力与当前市场竞品的对比。

  2. Google DeepMind76

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,旨在处理复杂、长周期的跨领域工作流。该模型在 DeepSWE v1.1 上达到 77.9% 的 SOTA 水平,输出 token 上限提升至 100 万,定价为每百万输入 token 2 美元、输出 token 10 美元。

    推荐理由:原文详细列举了模型在软件工程、金融法律和网络安全等领域的性能表现及定价,读者可以据此评估其实际应用潜力。

9月30日周三
  1. 开源中国62

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,官方称其为一次重大升级,覆盖专业办公、操控电脑和 agentic 编程等任务。其智能水平接近 Astra,但价格仅为后者的五分之一。

9月29日周二
  1. 开源中国60

    Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 以上

    Anthropic 发布了 Claude Sonnet 5.5,定位为 Opus 5.5 的快速、低成本互补版本。官方称其速度比 Sonnet 5 快 30% 以上,多数任务成本低 30%,在 Agent 编程评测中成绩从 10% 跃升至 70%。

    推荐理由:原文给出了速度提升、成本降低和特定评测的进步幅度,读者可以据此判断它是否适合高频日常任务。

9月28日周一
9月23日周三
  1. AI Business62

    Anthropic 发布 Claude Opus 5.5 模型

    Anthropic 发布了 Claude Opus 5.5 模型,擅长复杂的多步骤软件任务和知识密集型工作负载。其定价为每百万输入 token 4 美元、输出 token 20 美元,比 Opus 5 降价 20%,但仍高于同日发布的 OpenAI GPT-6 Sol 和 GPT-6 Luna。

    推荐理由:原文提供了新模型在编码任务上的具体性能数据、价格变化以及与竞品的详细对比,读者可以据此评估其性价比。

  2. ZDNet · AI63

    Anthropic 发布 Claude Opus 5.5,性能对标 Fable 5.1 且成本降低 40%

    Anthropic 发布 Claude Opus 5.5,宣称其在多数工作上达到 Fable 5.1 的性能水平,且运行成本降低约 40%。模型输出速度比 Opus 5 快 30% 以上,token 价格降低 20%,订阅用户的 5 小时使用额度增加 20%。Anthropic 强调该模型在安全对齐方面有显著改进,并引入了针对网络安全和生物研究的验证程序。

    推荐理由:文章引用了多家企业客户的实际测试数据,为评估 Claude Opus 5.5 在成本、效率和安全性方面的提升提供了具体参考。

9月5日周六
  1. AI Business67

    OpenAI 发布 GPT-6 Astra,强调其安全性与计算机使用能力

    OpenAI 发布了专注于计算机使用和网络安全的 GPT-6 Astra 模型,称其为对齐程度最高的模型,能更好地理解用户意图和模型行为。该模型可以执行填写在线表格、更新 CRM 记录、组织日程、在线研究和起草邮件摘要等任务。

    推荐理由:原文提供了关于模型安全能力、潜在风险及行业趋势的第三方分析,有助于理解这类智能体的能力边界和竞争格局。

9月3日周四
9月2日周三
  1. Google · AI Blog34

    Google 2026 年 8 月 AI 新闻汇总:发布 Gemini 3.7 Flash、Gemini 3.5 Transcribe 及 Pixel 11 系列

    Google 在 2026 年 8 月发布了多款 AI 产品,包括面向编程和智能体的高效模型 Gemini 3.7 Flash,以及专为实时转录设计的 Gemini 3.5 Transcribe。同期推出的 Pixel 11 系列设备搭载了 Google Tensor G6 芯片和最新的 Gemini Nano 模型。此外,Gemini 应用的月活用户已超过 10 亿。

8月28日周五
  1. fal 博客59

    fal 发布 H3 Max 视频生成模型

    fal 发布了 H3 Max,这是一个基于 MiniMax H3 进行后训练优化的视频生成模型,在人类偏好评估中,其在整体质量、提示词理解和美学三个维度均排名第一。该模型生成 5 秒视频的时间不到 3 秒,吞吐量约为官方 MiniMax H3 端点的 35 倍。H3 Max 现已上线 fal 平台,可通过 Playground、fal Agent 或 API 使用。

    推荐理由:原文展示了模型在质量和速度上的双重优势,并提供了与原始模型的对比数据,读者可以据此评估其实际应用潜力。

8月10日周一
  1. Ollama 博客57

    Meta Superintelligence Labs 的 Muse Glimmer 模型已在 Ollama 上线

    Meta Superintelligence Labs 发布的首个开源多模态模型 Muse Glimmer 现已可在 Ollama 上运行。这是一个 30B 参数、专为本地智能体工作负载设计的模型,拥有 128K+ 上下文长度,采用 Apache 2.0 许可证。

    推荐理由:原文提供了模型参数、许可证、支持的智能体框架和性能优化细节,读者可以据此评估其本地部署的适用性。

5月29日周五