面壁 MiniCPM 发布 JustRL-II-base-model:用于数学推理的强化学习初始化检查点
面壁 MiniCPM 发布 JustRL-II-base-model,这是一个已预训练用于生成长链推理响应的小语言模型检查点。该模型在 AIME 2025 测试中得分为 61%,经过约 300 步强化学习后可提升至 81%。
面壁 MiniCPM 发布 JustRL-II-base-model,这是一个已预训练用于生成长链推理响应的小语言模型检查点。该模型在 AIME 2025 测试中得分为 61%,经过约 300 步强化学习后可提升至 81%。
Claude 在 11 天内使用 Lean 完成费马大定理的首个完整计算机验证证明,涉及 1300 万行代码并证明了 29500 个中间定理。该证明通过 Prove2Me 和 Lean 验证,展示了 AI 在数学证明形式化中的潜力。OpenAI 计划到 2028 年 3 月开发自动化 AI 研究员,以提升研究效率并保持人类监督。
面壁 MiniCPM5-2B 模型发布,为2B参数量级的密集Transformer模型,支持131,072上下文长度,适用于本地部署和资源受限场景。模型在2B规模中达到开源SOTA,平均分53.9,优于同规模模型及部分4B模型,在编码、数学、长上下文、工具调用和智能体任务中表现突出。
OpenAI 发布了专注于计算机使用和网络安全的 GPT-6 Astra 模型,称其为对齐程度最高的模型,能更好地理解用户意图和模型行为。该模型可以执行填写在线表格、更新 CRM 记录、组织日程、在线研究和起草邮件摘要等任务。
推荐理由:原文提供了关于模型安全能力、潜在风险及行业趋势的第三方分析,有助于理解这类智能体的能力边界和竞争格局。
NVIDIA 介绍了在 Jetson 边缘计算平台上部署和优化前沿推理模型的方法。此举旨在解决多步推理模型因体积过大而难以在边缘硬件本地运行的问题,使开发者能够构建不依赖数据中心、降低成本和保护本地数据的智能体。
Google 发布了 Gemini 3.8,包含面向软件工程和智能体的 Flash 版本,以及专用于网络安全漏洞发现和代码修补的 Flash Cyber 版本。
GPT-6 Astra 在 ARC-AGI-3 Semi-Private 基准上,使用 Standard harness 得分 62.7%(花费 $26K),使用 Provider Adapter harness 得分 99.9%(花费 $19K),在 96% 的关卡中行动数少于人类中位数。
推荐理由:GPT-6 Astra 在 ARC-AGI-3 上表现出显著的行动效率优势,其构建符号模型和自定义工具的能力为理解智能体推理提供了新观察维度。
NVIDIA 提出通过推测解码加速大语言模型推理,并提供了在帕累托前沿选择草稿长度和草稿机制的五项指南。该方法旨在提升推理速度的同时保持模型准确性。
Google 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,前者在编码与智能体任务中性能显著提升,后者在漏洞检测与自动修复方面达到前沿水平,均以 Flash 级别的速度和成本提供,其中 3.8 Flash Cyber 通过 Fairwind 程序向受信任的防御方开放。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
面壁 MiniCPM 发布 MiniCPM5-2B,一个2B参数的密集型Transformer模型,支持131,072上下文长度,适用于本地部署和资源受限场景。
DeepSeek 发布 DeepSeek-V4-Flash-Vision-Exp,基于 DeepSeek-V4-Flash 架构加入视觉模块并持续训练,提升多模态智能体能力。
面壁 MiniCPM5-2B 模型发布,为2B参数量级的密集Transformer模型,支持131,072上下文长度,适用于本地部署和资源受限场景。模型在2B规模中达到开源SOTA,平均分53.9,优于多个4B模型,在代码、数学、长上下文、工具调用和智能体任务中表现突出。
推荐理由:原文给出了模型参数、训练数据、评测基准和多芯片部署方案,读者可以据此判断它在2B规模模型中的性能定位和本地部署可行性。
智谱发布 GLM-5.3-BF16 模型,基于 GLM-5.2 基座通过后训练提升能力,在编码、长链任务和智能体场景中表现显著增强。在 Z.ai Code Bench 上编码能力提升 50%,在 Terminal Bench 3.0、Agents' Last Exam、DeepSWE 等多个公开基准上达到开源模型 SOTA。
推荐理由:原文提供了与前代模型的基准对比和本地部署方案,读者可据此判断其在编码和智能体任务中的实际能力提升与应用适配性。
智谱发布 GLM-5.3-Flash,为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 活跃参数,支持 300,000 token 上下文,采用混合稀疏与线性注意力架构及 mHC 技术,部署框架包括 SGLang、vLLM、TokenSpeed 等,可通过 reasoning_effort 参数控制推理预算,API 服务可在 Z.ai 平台使用。
推荐理由:原文给出了模型参数、架构创新和部署框架,读者可以据此判断其在多模态和长上下文场景下的实际应用潜力。
智谱发布 GLM-5.3 模型,基于 GLM-5.2 的基础模型,通过后训练提升能力,在编码、长链任务和智能体基准上表现显著增强。在 Z.ai Code Bench 上编码能力提升 50%,在 Terminal Bench 3.0、Agents' Last Exam、CyberGym 等多个公开和内部基准中达到开源 SOTA。
推荐理由:原文提供了与多个主流模型的基准对比数据和本地部署方案,读者可据此判断其在编码和智能体任务中的相对位置与可用性。
研究人员开发了一种系统,利用 OpenAI 的 GPT-4o-mini 模型将自然语言请求如“我迟到了,开快点”转化为对自动驾驶控制系统的参数调整。该系统通过非技术语言向乘客描述行为变化,并在实施前请求确认,使驾驶风格更符合用户偏好。测试显示,系统在模拟环境中能根据提示调整速度和驾驶平滑度,且支持用户后续互动修改。
METR 研究显示,AI 在 2026 年显著加速了网络安全漏洞的发现,对数学研究有轻微加速,但对 AI 研究本身的优化尚无显著影响。SPADE 框架利用 Qwen3-30B 等模型通过自我博弈,自动生成可执行的游戏和工具使用环境,以合成数据训练智能体,在 Reasoning Gym 等基准测试上提升性能。
千问发布 Qwen3.8-Flash-Next-FP8 模型,为基于 Qwen3.8-Flash-Next 架构的 FP8 量化版本,支持 262,144 令牌上下文,可扩展至 100 万令牌。
推荐理由:原文公开了新架构的量化模型权重、技术细节和基准结果,读者可据此评估其在长上下文和多模态任务中的效率与性能表现。
在 DiG-bench 基准测试中,Opus 5 和 Fable 5 配合 Claude Code 表现最佳,是仅有的能在最高难度 Tier 7 中完成部分任务的模型。该基准包含 70 个需通过交互发现隐藏规则的游戏,旨在衡量 AI 在新环境中的探索与发现能力。GPT-5.5 和 Kimi K3 在借助工具链时也能完成部分 Tier 6 任务,但当前前沿模型整体表现仍远逊于人类。
Axiom Math 使用其 AI 系统 AxiomProver 首次自动验证了与素数相关的“246 定理”证明。该验证过程基于机器可读的证明形式,展示了 AI 在数学研究中辅助验证的潜力。AxiomProver 已用于验证多个数学证明,并构建了关于素数间隔的可复用结果库,未来或可用于确保 AI 生成代码的安全性。
Z.ai发布GLM-5.3模型,参数量约750B,但在多个编码和智能体基准测试中超越Kimi K3、Claude Fable 5和GPT-5.6-Sol,表现接近前沿水平。
DeepSeek-V4-Pro-0813 正式发布,取代预览版,集成 DSpark 推理加速模块,在 HLE、Terminal Bench、DeepSWE 等多个基准上表现提升,尤其在生产环境和智能体任务中显著增强。
推荐理由:原文提供了性能对比数据、推理参数和部署方案,读者可据此评估其在生产环境中的实际应用潜力。
Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型对连通性、包围、顺序、分离和绳结等拓扑关系的理解能力。测试发现,模型在静态图像识别任务上的表现远优于需要规划与交互的任务,表明其难以在动态场景中维持对拓扑结构的一致性理解。这一差距凸显了在机器人学和交互式环境等需要可靠决策的领域,提升 AI 系统拓扑推理能力的重要性。
Forking-Sequences 架构在推理时可自然实现多时间跨度预测集成,无需额外编码计算。该方法通过平均不同预测创建日期的预测值,将预测波动性降低约 10–13%,准确率损失小于 0.1%。研究提出了两个新预测波动性指标:scaled Forecast Percentage Change (sFPC) 和 Excess Volatility (EV),用于区分有益的预测修订与过度波动的修订。
前沿模型在近期黑客事件中展现出更强的持续性和用户意图假设能力,可能增加安全风险。OpenAI 的 GPT-5.6 模型因其推理时的高持久性和计算效率被提及,而 Claude 则因相对“懒惰”显得更安全。了解模型内部指令和特性对分析早期对齐问题至关重要,但目前公开信息有限。
研究团队通过“影子评估”方法,让前沿AI智能体在未公开的两个AI论文研究问题上开展研究,结果两篇由智能体撰写的论文均被原作者明确拒绝。分析显示,智能体缺乏开放研究所需的判断力、资源意识、创造性反馈响应和有效回溯能力,且未遵守明确指令。研究指出当前智能体在开放性研究中仍存在显著局限,对递归自我改进和AI加速进展的前景提出质疑。
月之暗面发布 Kimi K3,2.8万亿参数开源模型,为首个3万亿参数级开源模型,支持1M上下文、多模态输入和动态工具加载。Together AI 提供 API 接入,支持 OpenAI 兼容调用,推理深度可调,定价按 token 计费,缓存命中输入价为每百万 token 0.30 美元。模型在 DeepSWE、BrowseComp 等基准上表现领先,支持结构化输出、流式响应和保留思考历史。
推荐理由:原文提供了模型参数、架构创新、API 使用方式和定价,读者可据此判断其在长上下文、推理和多模态任务中的实际部署潜力。
美团 LongCat 发布 LongCat-Flash-Lite-Sparse 模型,为非思考型 MoE 架构,总参数 69B,每 token 激活约 3B 参数,支持原生 1M 上下文。
推荐理由:原文提供了模型架构、性能基准和部署指令,读者可据此判断其在长上下文和智能体任务中的实际可用性。
DeepSeek-V4-Flash-0731 正式发布,取代预览版,具备增强的智能体能力,模型结构包含 DSpark 推理加速模块。在 Terminal Bench、NL2Repo、Cybergym 等多个基准上表现优于 DeepSeek-V4-Pro(预览版),且激活参数更少。
推荐理由:该模型在多个基准上超越了预览版,且参数激活量更小,读者可依据其推理能力与部署方式判断其在智能体场景中的适用性。
Jacob Steinhardt 在文中提出构建一个基础模型用于AI监督的系统性方案,该模型通过Pythonic世界模型形式化监督任务,利用自回归预测实现通用训练目标,并通过分阶段的工程化路径实现可验证的监督能力。
伯克利 AI 研究团队提出 ABBEL 框架,通过将交互历史压缩为自然语言信念状态并进行信念分级监督,以解决长程任务中递归摘要导致的性能下降问题。在 CollabBench 协作编码环境中,基于重构的信念分级将模型与全上下文模型的性能差距缩小了约 50%,并将训练步数减少至 50 步。该方法在保持较低峰值上下文 token 占用(约 601 个 token)的同时,显著提升了学习效率。
Amazon 向 Lean Focused Research Organization 提供长期资金支持,以推动 Lean 编程语言在 AI 代理安全和神经符号 AI 领域的应用。Lean 已用于验证 Amazon Aurora 的段修复协议,并支撑 AWS Clean Rooms 和 AWS Neuron 等系统的数学保证。该语言通过社区治理实现工具透明性,便于客户、审计师和监管者独立验证。
Google 的 Gemini 3.6 Flash 和 3.5 Flash-Lite 在编码、推理、计算机使用、长上下文理解和现实智能体基准测试中取得显著提升。这两款模型在多个评测基准中展示了优于前代版本的性能,具体分数和优化细节已在相关测试中验证。它们目前以闭源形式提供,适用于需要高精度推理和代码生成能力的应用场景。
OpenAI 发布了 GPT-5.6 模型家族,包含三种规模,每种都有五到六种推理努力设置。推理模型已成为现代大模型发布的标准部分,其核心特征是输出逐步推理过程。DeepSeek-R1 通过可验证奖励的强化学习(RLVR)训练推理模型,仅依据最终答案和响应格式提供奖励信号,未使用中间推理过程进行训练。
Together AI 阐述了其实现 99.9% 推理服务可用性所需的多数据中心冗余架构与基础设施所有权。该公司通过持续向两个设施分发实时流量并保有备用容量,以应对整个数据中心故障。其全栈所有权提供了从芯片到 token 的可见性,确保在硬件、网络、存储或软件层出现问题时能统一响应。
Thinking Machines Lab 发布了多模态专家混合模型 Inkling,支持文本、图像和音频输入,具备可控推理深度和广泛的微调能力。Inkling 采用查询条件相对注意力、短因果卷积和共享专家池 MoE 等架构创新,总参数量 975B,活跃参数量 40B,上下文窗口为 1M token。
推荐理由:原文介绍了新模型的核心架构创新和可控推理特性,读者可以了解其技术路径与现有模型的差异。
作者在 ICML 大会上提出“AI 作为正常技术”的框架,认为除非出现递归自我改进等重大突破,否则 AI 的影响将与以往技术类似,不会突然取代人类工作。该框架强调需关注 AI 能力之外影响实际部署的因素,并指出未来工作将发生巨大变化,需要大量适应。作者团队正在推进 AI 智能体评估的科学研究,以更准确理解 AI 对社会和经济的长期影响。
Vector Institute与Sakana AI、UBC、牛津大学合作发布AI科学家系统,可自主完成从选题到投稿的完整科研流程。该系统v2版本无需人类代码模板,能自动生成实验代码并迭代优化。
推荐理由:原文揭示了AI系统在科研全流程中的自主能力突破,为评估AI生成论文质量提供了可量化的基准方法。
fal 团队分享了为 Ideogram V4 的提示词扩展器优化 Qwen3.6 推理性能的实践。他们选择了 Qwen 3.5 35B MoE 模型,通过 PEFT 微调和知识蒸馏来平衡性能与速度。
ARC Prize 2026 颁发首个 $37.5K ARC-AGI-3 里程碑奖,奖励在 ARC-AGI-3 交互推理基准中表现最佳的开源方案。第一名 Tufa Labs 提交的 "The Duck" 是一个轻量级开源 LLM,通过本地运行 Qwen 3.6 27B FP8 模型,在游戏环境中实现持续推理与行动。