On-Policy 参数更新方向是 LLM 后训练泛化性能的关键
研究发现,On-Policy 后训练范式的泛化优势源于其参数更新方向,并据此提出了 On-Policy 方向约束的监督微调方法 OPSFT。OPSFT 将 SFT 的更新约束在 On-Policy 范式识别出的方向上,从而将后者的强泛化能力转移给 SFT。该方法结合了 On-Policy 的泛化优势与 SFT 的高训练效率及利用高质量轨迹的能力。
研究发现,On-Policy 后训练范式的泛化优势源于其参数更新方向,并据此提出了 On-Policy 方向约束的监督微调方法 OPSFT。OPSFT 将 SFT 的更新约束在 On-Policy 范式识别出的方向上,从而将后者的强泛化能力转移给 SFT。该方法结合了 On-Policy 的泛化优势与 SFT 的高训练效率及利用高质量轨迹的能力。
RLE-Bench 发布,用于评估编码智能体在机器人学习工程中的综合能力,涵盖交互控制、策略学习、感知估计和机械设计四类工作流。该基准采用任务特定指标评估智能体生成的策略成功率、构建的工具链和设计的机械结构,整合为 RLE 指数与工作流能力画像。该评测为未来智能体在物理世界中的工程化能力训练提供系统性评估框架。
独立电影人 Jeff Synthesized 凭借短片《The Gifted》在全球 Future Vision XPRIZE 竞赛中赢得大奖。该片从全球 2500 多份作品中脱颖而出,讲述一个男孩用代码重现已故母亲声音的故事,获得了 10 万美元奖金及 250 万美元的电影制作资金。
四位开发者展示了使用 Gemini 3.8 Flash 构建的多种应用,包括卫星路径映射、动态水墨画生成、3D 恐龙骨架创建和自动变速器模拟。Gemini 3.8 Flash 在多步骤推理和 STEM 领域表现优于 3.7 Flash,接近更高成本的前沿模型。该模型可通过 Google Antigravity 和 Google AI Studio 使用,支持多模态功能和复杂任务处理。
Mistral AI 在德国慕尼黑开设新中心,专注于工业 AI 和 Physics AI 研究与应用。该中心将组建专门研究团队,并与宝马、西门子能源等企业合作开发工业 AI 应用。Mistral 强调其开放权重架构和欧洲本地计算基础设施,以保障欧洲的 AI 主权。
布鲁克林杂货店 Edy's Grocer 使用 Gemini 将家庭食谱按需转换为大型餐饮批量配方,并自动生成按货架分类的购物清单。Gemini 还能快速提供符合饮食限制的创意食材替换方案,帮助店主节省行政任务时间,专注于推广黎巴嫩美食与文化。
Cloudflare 发布 Vinext 1.0,可将基于 Pages 或 App Router 的 Next.js 应用移植并部署到 Cloudflare Workers 免费计划、Netlify 或 AWS Lambda 等任意 Web 平台。
Cloudflare 为其专为 AI 智能体设计的浏览器 Kitesurf 发布更新,新增对 WebMCP 的支持,使智能体能直接调用网站功能。Kitesurf 还扩展了支持的 Web API,通过了超过 73 万项 Web Platform Tests 子测试,并针对智能体循环延迟进行了内部引擎优化。该浏览器现已完全支持 Browser Run API,并推出了可在终端中运行的版本。
NIST 于 9 月 23-24 日召开国家建设安全团队顾问委员会会议,介绍了对佛罗里达州 Surfside 希望之塔南楼部分坍塌事件的调查进展,以及 2017 年飓风 Maria 对波多黎各影响的调查情况。
LangSmith 推出自定义应用功能,允许用户基于其智能体数据构建、发布和运行专属界面,无需自行处理托管、认证和权限问题。该功能支持通过聊天提示或代码构建,Plus 和 Enterprise 计划用户可直接在 LangSmith Chat 中指定数据展示方式和可视化需求,生成可运行的应用。自定义应用可与 LangSmith 数据保持连接,用于重复性评审流程,提升人工反馈和实验对比的效率。
LangChain 发布 Engine v2,支持主动红队测试、自动验证修复方案并提升问题检测能力;推出 Managed Deep Agents v0.8,新增用户级内存。
推荐理由:原文给出了 Engine v2 的自动化修复能力、Deep Agents 的用户级内存和 Web 搜索功能,读者可据此评估其对生产级 Agent 开发的影响。
LangChain联合TypeSafe AI发布Jev决策模型,与LangGraph协同构建生产级智能体。Jev在结构化决策任务上比主流LLM快200倍、便宜400倍,支持并行、可预测、自一致的判断输出。
推荐理由:原文给出了Jev与LangGraph结合使用的方法和性能对比,读者可据此评估其在生产系统中的部署价值。
NVIDIA 将股票回购授权额度增加 1500 亿美元,使剩余总授权额度达到 2350 亿美元,成为历史上最大的股票回购授权增幅。公司预计将在 2028 财年之前完成该回购计划。NVIDIA 董事会认为,其增长由 AI 和加速计算平台的变革驱动,现金流使其能够投资相关技术并回馈股东。
Holo4 是新的通用智能体模型系列,包含 27B 密集版和 35B-A3B MoE 版,现已通过 H Models API 和 Hugging Face 提供。
推荐理由:原文提供了模型性能、成本对比和具体应用案例,读者可以评估其作为通用智能体在不同接口下的实际能力。
MIT 研究人员借助 AI 算法优化了包裹 mRNA 疫苗的脂质纳米颗粒配方,使其耐热性显著提升。新配方疫苗可在室温下稳定储存长达一年,或在 37 摄氏度下储存两个月,并在小鼠体内引发了与 Moderna 类似疫苗同样强的免疫反应。该 AI 算法能基于小数据集进行预测,将配方筛选所需的实验次数和开发时间大幅减少。
NVIDIA 发布开放智能体安全平台,包含开源软件 OpenShell 和参考系统设计 Sentry,实现从测试到部署的全栈安全控制。OpenShell 在 NVIDIA Vera CPU 上提供安全运行边界,Sentry 通过 BlueField-4 DPU 实现毫秒级行为监控与隔离。
推荐理由:原文给出了平台组成、硬件协同机制和生态合作方,读者可以据此判断它如何实现跨栈安全控制。
NVIDIA 推出了 Open Agent Safety Platform,这是一个用于持续监控硅内 AI 智能体安全性的参考平台。该平台旨在应对智能体 AI 带来的机遇与风险,为开发者提供安全监控的参考实现。
NVIDIA OpenShell 为 AI 智能体提供运行时控制功能,使其能根据新信息持续执行任务。该工具支持智能体在长时间运行中访问工作空间、计算资源、数据、凭证和外部服务。NVIDIA 开发者博客指出,这一功能扩展了智能体在软件故障分析、实验运行和业务关键操作中的应用潜力。
NVIDIA DSX MaxLPS 通过策略管理的动态功率共享技术,在 AI 工厂中按需分配 GPU 间的功率。该方案允许客户在正常运行时部署更多 GPU,从而提升基础设施的整体利用率与吞吐量。
Anthropic 的 Claude Sonnet 5.5 模型已在 Vercel 的 AI Gateway 上架。该模型在编码、文档制作、幻灯片和电子表格生成等日常工作任务上相比 Claude Sonnet 5 有所改进,并支持 AI Gateway 的 Zero Data Retention 策略。
本文提出了一种改进的联邦变分不等式(VI)优化收敛速率方法,针对一般平滑且单调的变分不等式,展示了经典 Local Extra SGD 算法在精细分析下具有更紧的收敛保证。研究还指出了该算法存在客户端漂移的固有局限,并提出了 LIPPAX 算法以缓解这一问题,在多个场景中实现更优的收敛性能。最后,研究将结果扩展到联邦复合变分不等式,进一步提升了收敛速率的理论边界。
PDE-JEPA 提出了一种基于预测性表征学习的参数化偏微分方程(PDE)动力学建模方法,通过掩码潜在预测训练编码器并引入几何投影器对齐潜在轨迹与物理场演化几何。该框架进一步开发了物理结构化的潜在预测器,将动力学分解为参数无关和参数相关的部分,在九个常用 PDE 基准测试中,其在分布内任务平均优于现有最先进方法 33.4%,在未见过的参数外推任务中平均提升 51.4%。项目页面已上线。
Llama3 与 Qwen2.5 在科学、医学和算术任务上进行强到弱知识蒸馏实验,发现 rollout policy 并非决定性因素,token-level KL 方向对性能与输出覆盖影响更显著。
PersonaDose 在 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 上实现渐进式人格特质控制,相比对比激活添加方法,核心特质表达提升 33.2、18.3 和 17.8 点,达到 75 的一致性基线。校准后设置在未见问题上仍保持表达优势,7 个训练特质的平均目标误差为 4.7–6.2 点,28 个目标中有 14–22 个可达到。
Cloudflare 在年度创始人信中分析了 AI 驱动的互联网变革,指出 AI 智能体和爬虫的流量已在 2026 年 5 月超过人类流量,并可能在五年内达到人类流量的 1000 倍。这带来了“公地悲剧”风险,即智能体消耗大量网站资源却未给予补偿,可能挤压新进入者的生存空间。为此,Cloudflare 正推出技术以减少爬虫负载,并建立让内容创作者从智能体使用中获得报酬的机制。
Sakana AI 与东京大学合作提出 SAIL 方法,通过测试时扩展提升基于视觉语言模型(VLM)的机器人轨迹生成可靠性。该方法利用少量成功演示生成轨迹,在模拟器中测试并用评估 VLM 检查视频以识别停滞点,再通过蒙特卡洛树搜索(MCTS)优化轨迹。在六个模拟操作任务中,搜索预算从 1 增至 45 后,成功轨迹生成率从 25% 提升至 73%。
Fireworks 的 Ember-1 推理模型现已在 Vercel AI Gateway 上线。该模型基于 Kimi K3 构建,在其评估中能以相近的质量减少约 40% 的生成 token,并支持 100 万 token 的上下文窗口、图像输入和工具调用。Ember-1 目前作为研究预览版提供,Fireworks 端点支持零数据保留和无提示词训练。
internlm/Intern-Decision-4B 是基于 Qwen3.5-4B 微调的多模态结构化决策模型,支持在单次模型前向传递中处理共享状态、命名问题模式和可选图像,返回每个问题的答案分布。
internlm/Intern-Decision-2B 是基于 Qwen3.5-2B 微调的多模态结构化决策模型,支持在单次模型前向传递中处理共享状态、命名问题的模式和可选图像,返回每个问题的答案分布。
internlm/Intern-Decision-0.8B 是基于 Qwen3.5-0.8B 微调的多模态结构化决策模型,支持在单次模型前向传递中处理多个字段的选项评分。
MIT 学生在 Oklahoma Tulsa 的 Code.Tulsa 项目中参与开发 Muscogee 国家的 PRAMS 问卷,结合人文与工程视角分析部落历史与数据治理问题。项目由 PKG Center 主办,10 名学生与当地部落及非营利组织合作,完成 AI 和数据科学等技术任务。学生通过与社区互动,增强了对技术如何促进社会变革的理解,并计划将 STEM 技能应用于原住民社群。
X-Tree 从数据中自动提取可复用技能的层次结构,作为训练基础,无需 LLM 调用。在 WebArena、ScienceWorld 和 WebShop 上,该方法在相同数据与预算下,相较标准训练方案提升最高 4.5% 成功率(WebArena)、5.8%(ScienceWorld)和 4.1%(WebShop)。
Jev 决策模型在边缘服务编排中替代大语言模型,将中位决策延迟降低 22.7-64.5%。其延迟几乎不受输入规模、合同宽度或目录规模影响,在四字段合同中每项正确决策的 API 费用降低 59.7-80.9%,但精确匹配点略有下降。Jev 能准确识别未见过的服务,并在实时准入路径中保持 0.91-0.95 的请求准确率和准时率,而大语言模型在同等负载下低于 0.1。
研究者推出 OpenTumorBoard 基准,包含 611 个患者案例和 19,157 次讨论记录,评估大模型在两种医疗场景下的表现。14 个前沿模型测试显示,最佳模型在临床等效性上仅获 3.43/5 分。该基准将公开发布以支持个性化癌症决策的模型开发。
GitHub Copilot app 的 canvas 功能允许用户通过自然语言描述创建可自定义的共享界面,如看板或仪表盘。用户只需在会话中输入 `/create-canvas` 技能并描述所需工作流,智能体便会自动生成并打开界面。该界面支持双向实时协作,用户和智能体均可直接操作控件更新内容,且创建好的 canvas 可保存为扩展供重复使用。
Replit 宣布收购商业分析公司 Atta,并将其高质量图表技术集成到平台中。用户现可在 Replit 聊天中直接请求生成交互式数据可视化图表,无需编写 SQL 即可进行商业分析。该功能旨在让非技术用户也能便捷地探索数据、解释发现并采取行动。
Reactor 与 Amazon Neuron Science 团队合作,通过内核优化策略在 Trainium 上实现世界模型的实时视频生成。他们采用 Rolling Forcing 技术,该技术能以 16 帧每秒的速率生成高质量视频,满足实时播放需求。此次优化结合了世界模型的长序列生成能力与 Trainium 的高性能计算和内存支持,为未来实时视频生成模型提供了基础。
Cloudflare 推出 Turnstile Spin,让 AI 智能体能够自动完成 Turnstile 验证系统的端到端部署。该功能可将原本需要前后端分别配置的两步流程,简化为由智能体引导的自动化工作流,支持全新安装、修复未验证的组件以及从其他 CAPTCHA 迁移。自 7 月发布以来,已成功创建超过 65,000 个 Spin widget。
Microsoft 推出新版 Copilot,新增 Home、Code 和 Autopilot 三大功能。Home 整合 Chat 与 Cowork,集成 Word、Excel、PowerPoint 实时协作;Code 允许非开发者用自然语言构建应用,基于 GitHub Copilot 技术运行于安全沙箱;Autopilot 是持续工作的智能体,可自主执行任务并跨应用协作。
推荐理由:原文给出了新功能模块的定位、能力边界和开放路径,读者可以据此判断它会怎样改变现有工作流。
Vercel 基于 skills.sh 注册表数据发布《智能体技能现状》报告。该注册表在七个月内收录了 100 万个智能体技能,记录了近 2.8 亿次安装。报告分析了技能供需:供应侧以软件工程(约25%)等技术类为主,需求侧则更分散,软件工程(18%)、智能体工作流(15%)、业务运营与写作(各约11%)领先。
推荐理由:报告基于 skills.sh 注册表数据,揭示了技能供需分布、热门类别及生态增长模式,为理解智能体技能市场早期形态提供了量化视角。