Ego2Act:评估以第一视角生成视频中的目标导向操作
Ego2Act 是一个用于评估目标导向操作能力的基准,包含 110 个日常任务的 2,640 条视频,要求模型根据初始场景图像和高层目标生成第一视角的手部操作视频。Ego2ActJudge 作为无参考评估流程,比相关基线更贴近人类共识,发现模型常跳过或部分执行步骤,导致目标未达成,并在复杂物体操作和持久世界建模中表现不佳。该基准旨在推动视频模型向物理合理、目标导向的模拟方向发展。
Ego2Act 是一个用于评估目标导向操作能力的基准,包含 110 个日常任务的 2,640 条视频,要求模型根据初始场景图像和高层目标生成第一视角的手部操作视频。Ego2ActJudge 作为无参考评估流程,比相关基线更贴近人类共识,发现模型常跳过或部分执行步骤,导致目标未达成,并在复杂物体操作和持久世界建模中表现不佳。该基准旨在推动视频模型向物理合理、目标导向的模拟方向发展。
661.6M 参数模型在工具调用任务中得分0.660,而1,109M参数模型(经6B token工具微调)得分0.650,但前者在训练样本上可正确生成工具调用。
Hugging Face 提出 OctLLM,一种显式3D语言模型,通过将几何信息表示为 octree 占有 token 序列并采用稀疏 octree 结构,解决了现有模型在空间结构保留和参数效率上的不足。
EditHero 是首个用于评估长时程部件级3D编辑和Vibe建模的基准,通过自然语言指令和目标图像对几何和纹理进行测试。该基准使用确定性装配引擎生成每次编辑后的精确目标,并由人工审核每条编辑序列。研究对比了非智能体方法和LLM/VLM智能体方法,发现后者更准确执行指令并保留未编辑部分,但每次编辑耗时数分钟。
ScholarCatalyst 是一个用于检索启发新研究的论文基准,由 207 篇近期计算机科学论文的 184 位主要作者标注哪些论文对其项目有启发作用。该基准测试显示,即使使用 Claude Fable 5.1 构建的智能体,其检索效果(0.51 R@20)仍低于嵌入向量检索(0.48 R@20)。研究指出,当前模型在搜索大规模文献时缺乏专家级直觉,需开发新的训练方法来提升这一能力。
上下文检索通过追踪数据实体之间的关系而非单纯匹配词语,帮助 AI 智能体找到更相关的上下文。GraphRAG 在图结构中实现上下文检索,结合向量搜索与图遍历,提供连接的实体、事实、消息和决策路径。这种机制支持多步骤推理,提升准确性并减少模型幻觉,同时增强可解释性。
NVIDIA 通过 cuObject 和 SCADA Server SDK 扩展了对大容量文件与对象存储的高速安全访问,以支持 AI 工作负载。AI 训练、微调、推理上下文、工具调用、搜索和数据库查询等任务均依赖此类高速数据访问。
NVIDIA发布Open Agent Safety Platform,一个在硬件层面监控和终止AI智能体的参考设计。该平台基于BlueField-4 DPU和NVIDIA Sentry,通过隔离的网络路径实现对智能体行为的持续监控与毫秒级隔离,防止智能体逃逸后无法被及时终止。
推荐理由:原文介绍了NVIDIA在硬件层面部署AI智能体监控与终止机制的设计,读者可据此理解其对智能体安全控制的工程化路径。
NVIDIA 研究生奖学金项目现面向全球开放 2027-2028 学年申请,为从事 AI、机器学习、自动驾驶、计算机图形学等领域的博士生提供最高 6 万美元的资助。该项目已进入第 26 年,累计颁发超 220 份、总额约 800 万美元的奖学金。申请者需在 2026 年 10 月 30 日前提交,并须在 2027 年夏季于 NVIDIA 研究办公室完成实习。
Databricks 发布 ai_decide AI 功能,基于决策模型在毫秒级完成对受管数据的结构化判断,支持分类、评分与实时决策。该功能可在 SQL 中调用,也可通过 REST API 用于实时应用与智能体,延迟与成本显著低于传统 LLM。目前处于 Beta 阶段,兼容 TypeSafe AI 的 Jev 模型,支持在 Databricks 上直接运行开源决策模型。
PyTorch Conference North America 2026 即将在圣何塞举行,为开源 AI 社区提供交流平台。会议指南重点介绍了多场关于分布式计算框架 Ray 的议题,涵盖其与 Kubernetes 的协同演进、在 LinkedIn 和 Uber 等公司的生产级数据与模型训练应用,以及在模型推理与后训练阶段的关键作用。
Google 在全球 Gemini 聊天中推出 Skills 功能,用于保存和复用常用指令以自动化重复任务。Skills 将取代 Gems,并将在未来几周内为 Google Workspace 客户提供,个人账户的 Gems 支持将于 11 月停止。用户可以通过输入‘/’和技能名称来快速调用,并可以组合多个技能或添加参考文件。
推荐理由:原文明确了从 Gems 到 Skills 的迁移路径和时间表,读者可以据此规划现有工作流的调整。
微软研究院开发了一套端到端机器学习系统,可为美国本土 66,935 座变电站提供提前 30 至 60 分钟的位置特定空间天气风险预测。该系统结合太阳风观测、AE/Dst 指数预报、地质电导率与电网数据,在 2020-2026 年评估期内对重大事件的检测率达到 76.5%。
NVIDIA NeMo Relay 工具可用于追踪和分析智能体工作流中的低效行为。该工具能揭示导致延迟增加和 token 消耗的冗余步骤,例如失败的搜索或重复的文件读取,从而帮助开发者优化智能体性能。
Amazon Bedrock Knowledge Bases 提供了一种通过自然语言查询理赔文档并返回带引用答案的解决方案。该方案使用 AgenticRetrieveStream API 从 PDF、Word 和文本笔记中检索信息,并通过上下文对齐检查确保答案基于最新记录。应用可实时显示答案和引用来源,适用于处理理赔状态查询、多轮对话和元数据过滤等场景。
AWS 发布 Amazon Bedrock AgentCore Runtime Instances,支持多智能体在单个 GPU 实例上通过共享会话 ID 实现长期协作,具备多日持久化、GPU 支持、跨团队独立部署和混合打包格式共存能力,可用于音乐制作等复杂工作流。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
MIT Transit Lab 获得 Google.org 提供的 210 万美元资金,用于开发 Public Transit Intelligence Hub (PTIQ) 项目,该平台旨在整合公共交通机构的实时监控、运营控制和乘客通信系统。
Google DeepMind 发布 SynthID Bio,一种用于合成生物学的生物水印技术,可在不损害蛋白质生物功能的前提下,将不可见水印嵌入蛋白质序列与三维结构中。
推荐理由:原文给出了水印技术在生物序列和结构上的实现方式与实验验证结果,读者可据此评估其在生物安全中的实际应用潜力。
Atlas Agent Engine 与 Arize AX 集成,为 AI 智能体提供可治理的运行基础和细粒度可观测性。Arize AX 支持在 span 级别分析模型调用、检索步骤、工具调用、延迟和 token 使用情况,并通过 Signal 系统自动识别失败并建议修复。该集成基于 OpenTelemetry 标准,无需自定义代码即可发送 trace 数据,提升跨框架和模型的灵活性。
由MIT、卡内基梅隆大学、纽约大学和斯坦福大学研究人员开发的AI系统Ataraxos在《战略棋》比赛中以15-1-4的战绩击败了世界最强人类选手,并以39-2的战绩战胜了锦标赛顶级玩家。
CoreWeave 宣布其云平台已提供 NVIDIA Vera Rubin NVL72 系统,并成为首批提供该平台的云服务商之一。Cognition 作为首个生产用户,其 Devin AI 软件工程师的推理工作负载在 Vera Rubin NVL72 上实现了比 GB200 NVL72 高达 4.8 倍的 token 吞吐量提升。
Torch Spyre 基于 PyTorch 跨仓库 CI 中继(CRCR)实现了 L2 级集成,通过智能体流程从代码和执行证据中筛选并重组测试,并使用声明式 YAML 框架在不修改上游测试的情况下适配它们。这套方法旨在为任何通用的 privateuse1 设备提供可扩展的测试解决方案,并计划与 PyTorch 社区合作,将可复用部分上游化。
Cloudflare AI Gateway 的 User Insights 功能新增了识别模型过度使用的视图,帮助团队发现任务所需能力低于所选模型的情况。该功能可关联用户、智能体、应用程序及任务类别(如编码、研究、总结),并支持成本、延迟和对话轮次分析。这些洞察同时支撑了新推出的“潜在节省”视图和公开测试版 Auto Router,所有功能对 AI Gateway 用户免费开放。
Cloudflare 在 AI Gateway 中发布 Auto Router 公开测试版,通过自动将请求路由到性价比更高的模型来帮助组织降低 AI 成本。内部测试显示,相比仅使用 OpenAI Sol 和 Anthropic Claude Opus 等前沿模型,Auto Router 可节省高达 30% 的成本。
推荐理由:Cloudflare 通过其 AI Gateway 推出自动路由功能,旨在为组织在内部部署 AI 时提供成本控制方案。
Cloudflare 推出 Pay Per Use 测试版,允许内容发布者向已识别的 AI 公司授权内容,并根据实际使用情况(如被 AI 搜索引用、智能体报告引用)获得报酬。AI 公司定义付费用途和价格,发布者选择接受哪些报价,Cloudflare 负责处理注册、使用记录、计费和支付。该机制旨在为 AI 驱动的网络构建一个经济层,让内容在被他人产品使用时也能产生可持续收入。
推荐理由:原文详细描述了新机制的运作流程和商业逻辑,为内容创作者和AI公司提供了一种新的合作框架参考。
Cloudflare 发布 Monetization Gateway 测试版,允许网站、API、MCP 工具或数据集的拥有者向访问的 AI 智能体按次收费。该网关使用 HTTP 402 状态码,通过 Base 区块链上的 USDC 稳定币进行支付结算,无需重定向到结账页面或调用单独的支付 API。
推荐理由:原文展示了如何通过 HTTP 402 状态码和稳定币支付,让网站、API 和 MCP 工具直接向 AI 智能体收费,并给出了四个实际用例。
Cloudflare Registrar 全面更新了域名搜索与购买体验,并增强了对 AI 智能体的支持。新的搜索界面实时显示所支持的 420+ 后缀的精确结果,并可通过 API、MCP 及新推出的 cf CLI 让 AI 智能体直接搜索、注册或转移域名。该服务旨在为用户和智能体提供同样自然、简洁的交互体验。
Cloudflare 发布一系列产品与工具,帮助网站应对 AI 智能体流量超过人类流量带来的挑战。超过一半的互联网流量已非人类,导致网站收入下降而成本上升。Cloudflare 推出了 AI Crawl Control、Web Bot Auth、Disallow AI Training 等工具,让网站能识别、区分并控制不同 AI 流量。
推荐理由:原文详细阐述了非人类流量成为主流后网站面临的收入困境,并给出了 Cloudflare 提供的身份验证、流量控制和付费结算等具体解决方案。
Cloudflare 宣布重构其 Containers 服务,以更好地支持 AI 智能体工作负载。主要更新包括引入新的 durable_object 调度策略,允许在运行时选择沙盒镜像和实例类型,使容器启动速度提升 6 倍以上,并新增了文件系统快照功能。这些改进旨在让智能体能够按需创建、暂停和恢复工作空间,满足编码助手、评估和强化学习等场景的需求。
推荐理由:Cloudflare Containers 针对 AI 智能体工作负载进行了架构重构,提供了更快的启动速度和运行时配置能力。
OpenAI 披露其阻断了一次旨在提取受保护模型推理能力的有组织模型蒸馏攻击活动。该公司表示正在加强防御,以应对此类对抗性蒸馏攻击。
OpenAI 与美国小企业管理局发展中心合作,为小企业提供实践性 AI 培训和本地支持。同时发布了一份关于小型团队如何使用 AI 的新报告。
接受 Neo4j 初创企业计划后,需通过 Aura Console 创建账户、获取组织 ID、添加支付方式并提交确认邮件以激活信用额度。信用额度在提交组织 ID 后开始计算 12 个月有效期,未激活前不会过期。若公司名称变更或多人申请,需联系 startups@neo4j.com 处理以避免账单混淆。
Amazon Bedrock 现在支持在印度本地区域对 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5 进行推理。
Amazon Bedrock 现在支持在首尔和新加坡区域使用 Anthropic 的 Claude Opus 5 和 Claude Sonnet 5 进行本地推理,输入和输出数据全程保留在指定区域。用户可通过 Amazon Bedrock 控制台或 API 调用模型,无需额外配置即可测试不同模型变体。该功能适用于需满足数据本地化要求的金融、医疗及公共部门应用。
Hugging Face 推出 Open TTS Leaderboard,使用客观指标对开源文本到语音模型进行多语言和语音克隆评估。该榜单通过 Qwen3 ASR 计算词错率(WER)和字符错率(CER),并用 H200 GPU 测量推理速度(RTFx)和首次音频生成时间(TTFA),同时计算生成音频与参考音频的说话人相似度(SIM)。
一项系统研究发现,高效引导方法在控制大语言模型输出时常以牺牲流畅性为代价,且激活引导方法在指令微调模型上的效果远低于基础模型。简单提示和监督微调适用于概念注入,但概念移除效果不佳。文本指标与昂贵的LLM-as-judge评分高度相关,可为引导方法的行为提供洞察。
SCLATE 是一个执行基底,允许基准和未修改的智能体通过适配器将事件添加到一个共享的事件调度器中,实现任务与智能体事件的交错运行。SCLATE 使用混合模拟时钟在共享时间线上运行事件,可在数小时内压缩一个月的场景。
InclusionAI 的 Ling 3.1 Flash 模型已在 Vercel AI Gateway 上线,在 2026年10月13日前可免费使用。该混合推理模型总参数量为 560B,每 token 激活参数 25B,在 AI Gateway 上提供 262K token 的上下文窗口,适用于编码、多步骤分析和使用工具的智能体任务。
LangSmith 已上线 Jev 智能体评估功能,支持以低延迟、低成本方式对开放性代理行为进行结构化评估。用户可通过 LangSmith 的 Evaluators 页添加 Jev-as-a-judge 评估器,配置状态与 typed 问题,实现多指标并行评估,显著提升评估效率与成本效益。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
WeAreDevelopers World Congress North America 会议中,AI 生成代码的审查成为软件开发的主要瓶颈,多位演讲者指出人类审查速度有限,而基于智能体的代码审查同样存在速度限制。