跳到正文
8月31日周一
8月27日周四
  1. 面壁 MiniCPM 新模型58

    面壁 MiniCPM5-2B 模型发布

    面壁 MiniCPM5-2B 模型发布,为2B参数量级的密集Transformer模型,支持131,072上下文长度,适用于本地部署和资源受限场景。模型在2B规模中达到开源SOTA,平均分53.9,优于多个4B模型,在代码、数学、长上下文、工具调用和智能体任务中表现突出。

    推荐理由:原文给出了模型参数、训练数据、评测基准和多芯片部署方案,读者可以据此判断它在2B规模模型中的性能定位和本地部署可行性。

8月25日周二
  1. 智谱 GLM 新模型77

    智谱 GLM-5.3-BF16 模型发布,强化编码与智能体能力

    智谱发布 GLM-5.3-BF16 模型,基于 GLM-5.2 基座通过后训练提升能力,在编码、长链任务和智能体场景中表现显著增强。在 Z.ai Code Bench 上编码能力提升 50%,在 Terminal Bench 3.0、Agents' Last Exam、DeepSWE 等多个公开基准上达到开源模型 SOTA。

    推荐理由:原文提供了与前代模型的基准对比和本地部署方案,读者可据此判断其在编码和智能体任务中的实际能力提升与应用适配性。

  2. 智谱 GLM 新模型67

    智谱发布 GLM-5.3-Flash 多模态大模型

    智谱发布 GLM-5.3-Flash,为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 活跃参数,支持 300,000 token 上下文,采用混合稀疏与线性注意力架构及 mHC 技术,部署框架包括 SGLang、vLLM、TokenSpeed 等,可通过 reasoning_effort 参数控制推理预算,API 服务可在 Z.ai 平台使用。

    推荐理由:原文给出了模型参数、架构创新和部署框架,读者可以据此判断其在多模态和长上下文场景下的实际应用潜力。

  3. 智谱 GLM 新模型64

    智谱 GLM-5.3 发布:开源大模型在编码与智能体任务中取得显著提升

    智谱发布 GLM-5.3 模型,基于 GLM-5.2 的基础模型,通过后训练提升能力,在编码、长链任务和智能体基准上表现显著增强。在 Z.ai Code Bench 上编码能力提升 50%,在 Terminal Bench 3.0、Agents' Last Exam、CyberGym 等多个公开和内部基准中达到开源 SOTA。

    推荐理由:原文提供了与多个主流模型的基准对比数据和本地部署方案,读者可据此判断其在编码和智能体任务中的相对位置与可用性。

8月24日周一
  1. 千问 Qwen 新模型74

    千问 Qwen3.8-Flash-Next-FP8 模型发布

    千问发布 Qwen3.8-Flash-Next-FP8 模型,为基于 Qwen3.8-Flash-Next 架构的 FP8 量化版本,支持 262,144 令牌上下文,可扩展至 100 万令牌。

    推荐理由:原文公开了新架构的量化模型权重、技术细节和基准结果,读者可据此评估其在长上下文和多模态任务中的效率与性能表现。

8月13日周四
  1. DeepSeek 新模型71

    DeepSeek-V4-Pro-0813 模型正式发布,增强智能体能力与推理性能

    DeepSeek-V4-Pro-0813 正式发布,取代预览版,集成 DSpark 推理加速模块,在 HLE、Terminal Bench、DeepSWE 等多个基准上表现提升,尤其在生产环境和智能体任务中显著增强。

    推荐理由:原文提供了性能对比数据、推理参数和部署方案,读者可据此评估其在生产环境中的实际应用潜力。

  2. Microsoft Research38

    MindTopo 揭示多模态大语言模型的空间推理能力

    Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型对连通性、包围、顺序、分离和绳结等拓扑关系的理解能力。测试发现,模型在静态图像识别任务上的表现远优于需要规划与交互的任务,表明其难以在动态场景中维持对拓扑结构的一致性理解。这一差距凸显了在机器人学和交互式环境等需要可靠决策的领域,提升 AI 系统拓扑推理能力的重要性。

8月11日周二
  1. CMU 机器学习博客32

    Forking-Sequences — Part II: 多时间跨度预测集成与降低波动性

    Forking-Sequences 架构在推理时可自然实现多时间跨度预测集成,无需额外编码计算。该方法通过平均不同预测创建日期的预测值,将预测波动性降低约 10–13%,准确率损失小于 0.1%。研究提出了两个新预测波动性指标:scaled Forecast Percentage Change (sFPC) 和 Excess Volatility (EV),用于区分有益的预测修订与过度波动的修订。

8月1日周六
  1. Together AI72

    月之暗面发布 Kimi K3:2.8万亿参数开源模型,支持1M上下文与多模态

    月之暗面发布 Kimi K3,2.8万亿参数开源模型,为首个3万亿参数级开源模型,支持1M上下文、多模态输入和动态工具加载。Together AI 提供 API 接入,支持 OpenAI 兼容调用,推理深度可调,定价按 token 计费,缓存命中输入价为每百万 token 0.30 美元。模型在 DeepSWE、BrowseComp 等基准上表现领先,支持结构化输出、流式响应和保留思考历史。

    推荐理由:原文提供了模型参数、架构创新、API 使用方式和定价,读者可据此判断其在长上下文、推理和多模态任务中的实际部署潜力。

7月31日周五
  1. DeepSeek 新模型66

    DeepSeek-V4-Flash-0731 模型正式发布,增强智能体能力并支持 DSpark 推理加速

    DeepSeek-V4-Flash-0731 正式发布,取代预览版,具备增强的智能体能力,模型结构包含 DSpark 推理加速模块。在 Terminal Bench、NL2Repo、Cybergym 等多个基准上表现优于 DeepSeek-V4-Pro(预览版),且激活参数更少。

    推荐理由:该模型在多个基准上超越了预览版,且参数激活量更小,读者可依据其推理能力与部署方式判断其在智能体场景中的适用性。

7月26日周日
  1. Berkeley AI Research39

    ABBEL:通过信念更新与信念分级提升大语言模型长程交互效率

    伯克利 AI 研究团队提出 ABBEL 框架,通过将交互历史压缩为自然语言信念状态并进行信念分级监督,以解决长程任务中递归摘要导致的性能下降问题。在 CollabBench 协作编码环境中,基于重构的信念分级将模型与全上下文模型的性能差距缩小了约 50%,并将训练步数减少至 50 步。该方法在保持较低峰值上下文 token 占用(约 601 个 token)的同时,显著提升了学习效率。

  2. Amazon Science37

    Amazon 投资 Lean Focused Research Organization 以推动形式化验证发展

    Amazon 向 Lean Focused Research Organization 提供长期资金支持,以推动 Lean 编程语言在 AI 代理安全和神经符号 AI 领域的应用。Lean 已用于验证 Amazon Aurora 的段修复协议,并支撑 AWS Clean Rooms 和 AWS Neuron 等系统的数学保证。该语言通过社区治理实现工具透明性,便于客户、审计师和监管者独立验证。

7月21日周二
  1. Weights & Biases33

    Google 的 Gemini 3.6 Flash 和 3.5 Flash-Lite 基准分数表现

    Google 的 Gemini 3.6 Flash 和 3.5 Flash-Lite 在编码、推理、计算机使用、长上下文理解和现实智能体基准测试中取得显著提升。这两款模型在多个评测基准中展示了优于前代版本的性能,具体分数和优化细节已在相关测试中验证。它们目前以闭源形式提供,适用于需要高精度推理和代码生成能力的应用场景。

7月16日周四
  1. Together AI38

    Together AI 解读推理服务 99.9% 可用性的含义

    Together AI 阐述了其实现 99.9% 推理服务可用性所需的多数据中心冗余架构与基础设施所有权。该公司通过持续向两个设施分发实时流量并保有备用容量,以应对整个数据中心故障。其全栈所有权提供了从芯片到 token 的可见性,确保在硬件、网络、存储或软件层出现问题时能统一响应。

7月15日周三
  1. Together AI63

    Thinking Machines Lab 发布多模态 MoE 模型 Inkling

    Thinking Machines Lab 发布了多模态专家混合模型 Inkling,支持文本、图像和音频输入,具备可控推理深度和广泛的微调能力。Inkling 采用查询条件相对注意力、短因果卷积和共享专家池 MoE 等架构创新,总参数量 975B,活跃参数量 40B,上下文窗口为 1M token。

    推荐理由:原文介绍了新模型的核心架构创新和可控推理特性,读者可以了解其技术路径与现有模型的差异。

7月10日周五
  1. Vector Institute67

    AI科学家实现科研全周期自动化

    Vector Institute与Sakana AI、UBC、牛津大学合作发布AI科学家系统,可自主完成从选题到投稿的完整科研流程。该系统v2版本无需人类代码模板,能自动生成实验代码并迭代优化。

    推荐理由:原文揭示了AI系统在科研全流程中的自主能力突破,为评估AI生成论文质量提供了可量化的基准方法。

7月8日周三
7月6日周一
  1. ARC Prize35

    ARC Prize 2026: ARC-AGI-3 Milestone Prize #1

    ARC Prize 2026 颁发首个 $37.5K ARC-AGI-3 里程碑奖,奖励在 ARC-AGI-3 交互推理基准中表现最佳的开源方案。第一名 Tufa Labs 提交的 "The Duck" 是一个轻量级开源 LLM,通过本地运行 Qwen 3.6 27B FP8 模型,在游戏环境中实现持续推理与行动。

7月3日周五
  1. Vector Institute35

    Vector Institute 研究人员在 ICML 2026 推进生成式 AI、负责任 AI 与科学发现

    Vector Institute 研究人员在第 33届国际机器学习大会(ICML 2026)上展示了73篇被接收论文,涵盖强化学习、后训练、生成式AI、视频生成、多模态系统及AI治理等多个前沿领域。其中11篇被选为焦点论文,创下该研究所在ICML的最佳纪录。研究工作还涉及科学发现应用,包括基因组学、量子化学和材料建模。

7月2日周四
  1. Mistral 新模型40

    Mistral 新模型 Leanstral-1.5-119B-A6B 发布

    Mistral 发布了开源代码智能体模型 Leanstral-1.5-119B-A6B,支持 Lean 4 证明助手和复杂数学对象表达,参数规模为 119B,上下文长度达 256k tokens。该模型基于 Mistral Small 4 家族,具备多模态输入能力,推荐使用 "high" 推理努力模式处理复杂提示。用户可通过 Mistral Vibe CLI 或本地 vLLM 服务器部署使用。

6月30日周二
6月16日周二
  1. 智谱 GLM 新模型65

    智谱发布GLM-5.2大模型,支持1M上下文与多能力增强

    智谱发布GLM-5.2大模型,支持1M-token上下文,提升编码与推理能力,引入IndexShare架构降低计算开销,采用MIT开源许可。模型在HLE、AIME、SWE-bench等基准上表现领先,支持SGLang、vLLM等框架本地部署,提供API服务。

    推荐理由:原文提供了1M上下文、架构优化和开源许可等关键信息,读者可据此判断其在长上下文任务中的实际可用性与部署潜力。

6月13日周六
  1. 月之暗面 Kimi 新模型75

    月之暗面发布 Kimi K3 大模型,支持 100 万 token 上下文与原生多模态

    月之暗面发布 Kimi K3 大模型,参数量 2.8T,支持 100 万 token 上下文窗口,具备原生多模态和智能体能力,采用 KDA 和 AttnRes 架构,开源权重并提供 API 接入。模型在 GPQA Diamond、DeepSWE、FrontierSWE 等多个基准上取得领先成绩,支持 MXFP4 量化,推荐在 vLLM、SGLang 等引擎上部署。

    推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长上下文、多模态和智能体任务中的实际能力边界。

6月12日周五
6月11日周四
  1. 月之暗面 Kimi 新模型73

    月之暗面 Kimi-K2.7-Code 模型发布

    月之暗面发布 Kimi-K2.7-Code,一款基于 Kimi K2.6 的编码专用智能体模型,采用 MoE 架构,参数量 1T,激活参数 32B,上下文长度 256K,支持图像与视频输入。

    推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长程编程任务和智能体场景中的实际能力与适用性。

6月9日周二
  1. Amazon Science42

    Project Eluna 如何实现物理世界中的智能体对齐

    Project Eluna 是 Amazon 推出的智能体 AI 模型,用于在仓储中心等物理环境中自主执行多步骤任务。该模型通过物理引导深度学习、不确定性感知推理、文本到数值的桥梁构建等方法,确保推理符合物理规律并提升可靠性。其不确定性框架 UQ4CT 在五个基准测试中保持高准确率,同时将预期校准误差降低 25% 以上。

  2. Amazon Science63

    Amazon Science 发布论文:弥合智能体系统中的意图与执行差距

    Amazon Science 发布论文《Dissecting model behavior through agent trajectories》,提出智能体性能瓶颈在于模型意图与执行之间的差距,即意图-执行间隙。

    推荐理由:原文系统分析了智能体系统中模型意图与执行之间的差距,并提出可复用的轻量级框架SSA,读者可据此理解如何设计更鲁棒的智能体执行系统。

6月6日周六
6月2日周二
  1. Together AI59

    Together AI 详解如何高效推理服务 MiniMax M3 模型

    Together AI 作为 MiniMax M3 的优选云合作伙伴,分享了其针对该模型新特性的推理优化方案。M3 具备 100 万 token 上下文、原生多模态和稀疏注意力架构,Together AI 通过 KV 块主序稀疏注意力、与分页注意力的集成、解码索引评分优化以及网关预处理多模态输入等方法,在代理式流量下将推理性能提升了 81% 至 125%。

    推荐理由:Together AI 分享了其针对 MiniMax M3 模型稀疏注意力等新特性的推理优化细节,包括 KV 块重排、分页注意力集成和网关预处理。

5月29日周五
5月21日周四
  1. Weights & Biases36

    Qwen3.7-Max 基准测试成绩发布

    阿里巴巴 Qwen 团队推出了 Qwen3.7-Max,该模型专注于代码智能体、自主执行和长时程推理。模型在多个基准测试中取得优异成绩,包括在 HumanEval 和 SWE-bench 上的高分表现。Qwen3.7-Max 支持 8k 上下文长度,可通过 API 调用,适用于需要复杂推理和代码生成的场景。

5月12日周二
5月11日周一
  1. Together AI73

    Together AI 解析服务 DeepSeek-V4:为何百万 token 上下文是推理系统问题

    DeepSeek-V4 通过压缩 KV 缓存的 token 维度来支持百万 token 上下文,但这将压力转移到了推理系统。模型采用混合注意力设计,包括压缩稀疏注意力、重度压缩注意力和滑动窗口注意力,这要求推理引擎同时管理三种具有不同大小和生命周期的缓存对象。文章基于在 NVIDIA HGX B200 上的早期部署经验,分析了缓存策略、前缀复用和不同工作负载下的性能权衡。

    推荐理由:文章从推理系统角度剖析了 DeepSeek-V4 百万 token 上下文窗口的实现挑战,为开发者评估其实际部署成本提供了具体的技术视角。

5月8日周五
  1. Berkeley AI Research35

    自适应并行推理:高效推理扩展的下一个范式

    自适应并行推理让推理模型能自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们。这种方法旨在解决顺序推理因探索路径线性增长而导致的延迟增加、计算密集和上下文窗口受限问题。研究分析了从固定并行到自适应控制的各种方法,指出让模型根据问题自适应决策是提升并行化效果的关键。

5月7日周四
  1. OpenAI Alignment48

    OpenAI 探究在 RL 训练中意外对 CoT 进行评分的后果

    OpenAI 发现部分已发布的 GPT 模型在 RL 训练中意外接受了 CoT 评分,包括 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini。分析显示这些情况未造成 CoT 可监控性显著下降,但存在潜在风险。为防止类似问题,OpenAI 已修复相关奖励路径并加强内部流程与检测系统。

5月4日周一
5月1日周五
  1. ARC Prize59

    ARC-AGI-3 分析 GPT-5.5 与 Opus 4.7 的推理失败模式

    ARC-AGI-3 通过 135 个新颖环境测试模型的抽象推理能力,分析了 GPT-5.5 和 Opus 4.7 的 160 个推理回放,发现三种主要失败模式:局部效应无法转化为全局世界模型、错误抽象映射至训练数据中的游戏、解决单关但未学习游戏机制。

    推荐理由:原文通过分析 GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的推理轨迹,揭示了模型在抽象推理和世界模型构建中的具体失败模式,可为模型设计提供可迁移的诊断思路。

4月28日周二