跳到正文
  1. 钛媒体59

    StartLux 开源决策模型 StartLux-Decision,在多项基准测试中超越 Jev

    StartLux 开源了决策模型 StartLux-Decision,并一次性发布了 0.8B、2B、4B、9B、27B 五个参数版本。在 Decision Index 0.2.1 评测中,其 27B 版本得分 63.88,在 38 项基准中有 31 项高于 Jev 1.13;在另一套七项评测中平均准确率达 91.82%。

    推荐理由:原文提供了详细的基准测试对比和多种规格的量化版本,读者可以评估其在不同部署场景下的适用性。

  2. 极客公园62

    Tavus 发布实时交互模型 Griffin,近半数测试者未能分辨其为 AI

    美国 AI 视频公司 Tavus 发布实时交互模型 Griffin,在一项一分钟视频通话测试中,54 名参与者中有 26 人认为自己在和真人聊天。Griffin 采用端到端的全双工视频到视频架构,能实时生成语音、表情和手势,平均反应延迟为 0.43 秒。Tavus 表示该模型目前仅向少数受信任的测试者开放,并正在开发主动披露身份的安全功能。

    推荐理由:原文提供了模型的核心能力、技术架构和测试数据,读者可以据此评估其在实时交互领域的突破性。

  1. NVIDIA 新模型61

    NVIDIA 发布 PixelUMM:无编码器统一多模态模型

    NVIDIA 发布 PixelUMM,一个无编码器的统一多模态模型,支持文本、图像和视频的联合理解与生成,直接在像素空间处理,参数量 151.99 亿,基于 Qwen3-8B 语言骨干,仅限非商业研究或评估使用。

    推荐理由:原文给出了模型架构、参数量和开放入口,读者可以据此判断它在像素空间统一理解与生成的实现路径。

  1. Latent Space73

    Google DeepMind 发布 Gemini 4 Argon 模型,输出上限达 100 万 token

    Google DeepMind 发布了 Gemini 4 Argon 模型,专注于编码、企业知识工作和网络防御,并提供了 100 万 token 的输出上限。模型在 19 项可信基准测试中的 13 项取得领先,标准定价为每 100 万输入/输出 token 4/20 美元,目前通过 Fairwind 项目向政府用户和可信网络防御者提供有限预览。

    推荐理由:原文汇集了 Gemini 4 Argon 的发布详情、基准测试、定价和初步评测,读者可以了解其定位、能力与当前市场竞品的对比。

  2. 爱范儿64

    Gemini 4 Argon 正式发布,写作与长文本能力突出

    Gemini 4 Argon 正式发布,官方称其在写作、知识和长文本能力上领先,输出上限达 100 万 token,幻觉率降至 15%,API 定价为输入 2 美元/百万 token、输出 10 美元/百万 token。

    推荐理由:原文提供了 Gemini 4 Argon 的能力分布、输出上限和定价,读者可以据此判断其在写作与长文本任务中的相对优势和适用场景。

  3. Google DeepMind76

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,旨在处理复杂、长周期的跨领域工作流。该模型在 DeepSWE v1.1 上达到 77.9% 的 SOTA 水平,输出 token 上限提升至 100 万,定价为每百万输入 token 2 美元、输出 token 10 美元。

    推荐理由:原文详细列举了模型在软件工程、金融法律和网络安全等领域的性能表现及定价,读者可以据此评估其实际应用潜力。

  4. Google · Gemini 博客86

    Google 发布 Gemini 4 Argon 模型

    Google 发布 Gemini 4 Argon 模型,该模型在复杂软件工程、企业知识工作和网络安全防御中实现前沿性能,支持长达 100 万 token 的输出,已通过内部测试并面向受信任的网络安全团队逐步开放,定价为输入 token 每百万 2 美元,输出 token 每百万 10 美元。

    推荐理由:原文明确了模型在复杂任务中的性能跃升和安全防护机制,读者可据此评估其在实际工作流中的应用潜力。

  1. 开源中国62

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,官方称其为一次重大升级,覆盖专业办公、操控电脑和 agentic 编程等任务。其智能水平接近 Astra,但价格仅为后者的五分之一。

  1. 开源中国60

    Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 以上

    Anthropic 发布了 Claude Sonnet 5.5,定位为 Opus 5.5 的快速、低成本互补版本。官方称其速度比 Sonnet 5 快 30% 以上,多数任务成本低 30%,在 Agent 编程评测中成绩从 10% 跃升至 70%。

    推荐理由:原文给出了速度提升、成本降低和特定评测的进步幅度,读者可以据此判断它是否适合高频日常任务。

  1. Hugging Face Blog65

    Holo4 系列通用计算机使用智能体模型发布

    Holo4 是新的通用智能体模型系列,包含 27B 密集版和 35B-A3B MoE 版,现已通过 H Models API 和 Hugging Face 提供。

    推荐理由:原文提供了模型性能、成本对比和具体应用案例,读者可以评估其作为通用智能体在不同接口下的实际能力。

  1. AI Business62

    Anthropic 发布 Claude Opus 5.5 模型

    Anthropic 发布了 Claude Opus 5.5 模型,擅长复杂的多步骤软件任务和知识密集型工作负载。其定价为每百万输入 token 4 美元、输出 token 20 美元,比 Opus 5 降价 20%,但仍高于同日发布的 OpenAI GPT-6 Sol 和 GPT-6 Luna。

    推荐理由:原文提供了新模型在编码任务上的具体性能数据、价格变化以及与竞品的详细对比,读者可以据此评估其性价比。

  2. ZDNet · AI63

    Anthropic 发布 Claude Opus 5.5,性能对标 Fable 5.1 且成本降低 40%

    Anthropic 发布 Claude Opus 5.5,宣称其在多数工作上达到 Fable 5.1 的性能水平,且运行成本降低约 40%。模型输出速度比 Opus 5 快 30% 以上,token 价格降低 20%,订阅用户的 5 小时使用额度增加 20%。Anthropic 强调该模型在安全对齐方面有显著改进,并引入了针对网络安全和生物研究的验证程序。

    推荐理由:文章引用了多家企业客户的实际测试数据,为评估 Claude Opus 5.5 在成本、效率和安全性方面的提升提供了具体参考。

  1. 千问 Qwen 新模型55

    千问发布 Qwen-Image-2.1-PE-T2I 模型

    千问发布 Qwen-Image-2.1-PE-T2I,一个统一的文生图与图像编辑模型,参数量7B,支持透明图生成、多参考图编辑和局部修改,同时提供提示词重写模型。模型在 HuggingFace 和 ModelScope 开源,支持通过 Transformers 和 Diffusers 集成,输出包含详细英文提示和推荐宽高比的 JSON 结构。

    推荐理由:原文提供了模型架构、能力改进和开源入口,读者可据此判断其在生成效率与透明图支持上的实际应用价值。

  1. Microsoft 新模型60

    Microsoft 发布 FrogNano-4B-2609 模型:基于 Qwen3.5-4B 的紧凑型代码智能体

    Microsoft 发布 FrogNano-4B-2609 模型,基于 Qwen/Qwen3.5-4B 架构,通过强化学习在约 1,500 个合成软件工程任务上训练,专用于仓库级代码智能体任务。

    推荐理由:原文详细说明了模型架构、训练方法、基准表现和使用限制,读者可据此判断其在代码智能体领域的定位与适用边界。

  1. 上海 AI 实验室 新模型62

    上海 AI 实验室发布 Atria Dawn Preview 模型

    上海 AI 实验室发布新一代智能体模型 Atria Dawn Preview,基于 744B 参数 MoE GLM-5.2 基座,支持 256K 上下文窗口,专注于科研与工程场景中的环境理解、工具调用和多步任务完成。

    推荐理由:原文提供了模型架构、评测基准和部署方式,读者可以据此判断其在科研与工程场景中的实际应用潜力。

  1. DeepSeek 新模型75

    DeepSeek发布多模态MoE模型DeepSeek-V4.1-Flash,支持百万token上下文与可调推理努力

    DeepSeek发布多模态Mixture-of-Experts模型DeepSeek-V4.1-Flash,拥有552B参数,支持最多100万token上下文。模型采用CED架构,通过SWA Bounded Replay和CSA2技术将全局KV缓存降至890字节/token,约为前代的1/4。

    推荐理由:模型在KV缓存压缩和多模态能力上实现突破,支持百万token上下文和可调推理努力,对长上下文智能体应用有直接价值。

  1. AI Business67

    OpenAI 发布 GPT-6 Astra,强调其安全性与计算机使用能力

    OpenAI 发布了专注于计算机使用和网络安全的 GPT-6 Astra 模型,称其为对齐程度最高的模型,能更好地理解用户意图和模型行为。该模型可以执行填写在线表格、更新 CRM 记录、组织日程、在线研究和起草邮件摘要等任务。

    推荐理由:原文提供了关于模型安全能力、潜在风险及行业趋势的第三方分析,有助于理解这类智能体的能力边界和竞争格局。

  1. fal 博客59

    fal 发布 H3 Max 视频生成模型

    fal 发布了 H3 Max,这是一个基于 MiniMax H3 进行后训练优化的视频生成模型,在人类偏好评估中,其在整体质量、提示词理解和美学三个维度均排名第一。该模型生成 5 秒视频的时间不到 3 秒,吞吐量约为官方 MiniMax H3 端点的 35 倍。H3 Max 现已上线 fal 平台,可通过 Playground、fal Agent 或 API 使用。

    推荐理由:原文展示了模型在质量和速度上的双重优势,并提供了与原始模型的对比数据,读者可以据此评估其实际应用潜力。

  1. 面壁 MiniCPM 新模型58

    面壁 MiniCPM5-2B 模型发布

    面壁 MiniCPM5-2B 模型发布,为2B参数量级的密集Transformer模型,支持131,072上下文长度,适用于本地部署和资源受限场景。模型在2B规模中达到开源SOTA,平均分53.9,优于多个4B模型,在代码、数学、长上下文、工具调用和智能体任务中表现突出。

    推荐理由:原文给出了模型参数、训练数据、评测基准和多芯片部署方案,读者可以据此判断它在2B规模模型中的性能定位和本地部署可行性。