Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle
Google Research 发布了题为《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》的研讨会报告,探讨自主智能体在隐私与安全方面面临的基础性挑战,提出需在系统、模型、用户和生态系统层面进行协调防御。
Google Research 发布了题为《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》的研讨会报告,探讨自主智能体在隐私与安全方面面临的基础性挑战,提出需在系统、模型、用户和生态系统层面进行协调防御。
AWS推出aws-ai-ml技能,通过Agent Toolkit for AWS集成至Kiro、Claude Code、Codex等支持MCP协议的编码代理,提供SageMaker推理优化能力,包括端点基准测试、部署配置推荐、性能对比和生成可执行SageMaker Python SDK v3代码。
Arize 介绍如何用开源框架 Harbor 和 Phoenix 实现 AI 智能体的可复现评测,通过沙箱环境、任务验证器和轨迹记录,支持 PXI、Claude Code、Codex 等智能体的基准测试,并将结果作为 Phoenix 实验和追踪数据记录,用于分析智能体行为、优化提示词或技能。
Amazon Bedrock AgentCore 提供了一种全托管的评估能力,用于衡量多智能体系统在开发和生产环境中的准确性、任务成功率和行为表现。该平台支持内置评估器和自定义评估器,前者用于快速评估通用质量维度,后者用于验证供应链场景中的约束满足、路线可行性、SQL 正确性及可解释性。企业可通过此框架同时评估智能体响应的语言质量与业务决策的有效性。
Amazon Bedrock 管理知识库支持通过 AgenticRetrieveStream API 实现智能体式检索,将复杂问题拆解为多个子查询并逐步执行。与标准检索相比,该方法能更全面覆盖问题意图,但成本可能更高。文章演示了使用 LangChain 和 Amazon Bedrock 知识库构建 RAG 应用,并介绍了两种检索方式的权限配置及实现流程。
Amazon Quick 通过 API 和 Model Context Protocol (MCP) 服务器实现跨账户资源推广的自动化,支持创建、读取、更新和删除操作。该方案可在单次调用中推广资源,保留权限并提供版本化备份,确保可审查和回滚。推广过程包括聊天代理、操作连接器、知识库、流程和空间的配置迁移,且不复制 S3 对象本身,仅重建数据源和权限。
Genie Ontology 通过整合企业内部的认证定义、规则和权威来源,使 Genie 能够在推理过程中准确理解业务上下文。它结合了 Unity Catalog 中的核心概念、组织内的仪表板、文档和查询数据,并利用 OntoRank 对上下文进行权威排序。
Cloudflare 在 2026 年生日周推出了新的 agentic CLI、开源工具 Forge 和 EmDash 等项目。本周还发布了支持 WebMCP、更快 DOM 操作的 Kitesurf 浏览器更新,以及用于探索网站性能数据的 BEACON 工具。此外,Cloudflare 宣布将建立公共证书机构并推进后量子加密迁移,相关功能已开始在部分产品中展示。
Microsoft 与 Hugging Face 联合发布智能体评测基准 ThinkingBox,通过检查数据库最终状态和副作用而非工具调用来评估智能体。该研究在 507 个有状态工作流上对 12 个 LLM 模型进行了 20 次重复测试,发现模型的一次性成功率(pass@1)与始终正确率(20/20)之间存在巨大差距。
推荐理由:该研究通过检查数据库最终状态而非工具调用来评估智能体,揭示了模型一次性成功与可靠执行之间的显著差距。
Code2Games 是一个智能体框架,通过协调场景分析、游戏规划和引擎适配,从自然语言游戏意图生成结构一致的游戏世界。该框架基于 Blender 生成基础世界,并通过执行引导的重建过程提升 Unreal Engine 5 适配后的游戏质量。研究者引入了 GameCode4D 评测基准,从视觉质量、交互保真度等四个维度验证其效果,实验表明其在多个指标上优于现有方法。
ASCENT 提出一种在线测试时训练方法,通过自蒸馏验证经验提升长时地平线智能体性能。该方法在部署过程中利用智能体执行轨迹中的验证结果,更新其 LoRA 快速权重,无需外部参考方案或更强教师模型。在 ALFWorld、WebShop 和 AppWorld 等基准上,ASCENT 随着经验积累提高了任务成功率和交互效率,并优于其他在线适应方法。
Databricks Genie One 通过 AI 智能体在后台自动处理基金运营数据,生成可追溯的初步 NAV 数值。其结合实时数据和 Genie Ontology,确保财务数据在业务变化中保持准确与一致性。该系统能提升投资运营效率 55% 至 65%,并降低约 40% 的操作成本,适用于基金会计、对账和 NAV 管理等场景。
Databricks 提出一个基于五个核心变量的框架,用于评估和选择应优先构建的 Genie Agents。该框架通过业务影响、需求频率、数据就绪度、范围清晰度和治理风险匹配度对候选工作流进行 1-5 分评分,总分 20-25 分的工作流适合立即构建。一个活跃的高管支持者对于将高性能 Agent 转化为被广泛采用的工具至关重要。
AWS 博客介绍了名为 Adjudicated Query 的设计模式,用于在 Amazon Quick 聊天界面中处理大规模、高风险的合规审查。该模式将自然语言查询转换为对确定性规则引擎的固定调用,确保审查的完整性与可验证性,适用于租赁合规、制裁筛查等多个领域。
使用 Amazon SageMaker AI 多轮强化学习(MTRL)微调 Qwen3.6-27B 模型,构建了一个自主使用 BM25 和向量搜索工具的搜索智能体。
Arize AX 推出 MCP 服务器,支持在 Claude Code、Cursor 等工具中无需切换窗口即可调用 45 个工具,如列出项目、比较实验、检查监控等。
AI 正在改变开发者的工作方式,要求其掌握引导 AI 智能体而非仅使用工具、不盲信 AI 的首个答案并进行交叉审查,以及利用 AI 节省的时间去解决更宏观问题等三项关键技能。GitHub Copilot 内置的 Rubber Duck 智能体已采用第二模型来审查计划、代码和测试。开发者应将时间更多用于理解客户需求、评估权衡和做出 AI 无法替代的技术决策。
BetterHelp 首席增长官 Sara Brooks 通过创建 AI Excellence 职能和采用 WRITER 平台,在公司内部构建了 AI 原生营销引擎。团队利用 WRITER 存储品牌资产并生成内容,开发了从策略到创意的端到端智能体化活动流程,并通过 A/B 测试验证了其效果。Sara 本人每日亲自使用 WRITER 工作流,以领导者的亲身实践推动团队采用 AI。
LangChain 在其开源编码代理 Open SWE 中实现模型路由,通过任务分析与模型分级匹配,将中位数成本降低64%且质量无明显下降。该教程详细说明了任务分类、模型选型、路由逻辑设计及效果验证方法,并提供可复用的中间件工具。
推荐理由:原文给出了模型路由的构建步骤和实测效果,读者可直接复用其方法框架。
Arize 分析了 Anthropic 发布的 Claude hillclimb 方法,强调从生产日志构建评估集、混合代码和 LLM 评估器、优化成本与质量平衡,并通过 Arize AX 实现团队可复用的持续优化循环。
推荐理由:原文结合生产日志和评估循环,展示了如何让智能体优化从个人实验转向团队可复现的持续流程。
Cloudflare 通过 AI Gateway 推出 Web Search API,使 AI 智能体能获取实时网络信息。该 API 与 Ceramic.ai、Exa 和 Linkup 等合作伙伴共同推出,其网络爬虫遵守 Cloudflare 的“Verified bots”标准并尊重 robots.txt。
AutoSynthData 是 ServiceNow CoreAI 开发的工具,用于从企业智能体在特定环境中的失败案例生成训练数据。该工具结合目标模型的失败与更强教师模型的成功,生成符合环境约束、具有现实性和挑战性的任务。生成的任务包含系统规范、用户提示和验证器,用于提升模型在企业场景中的能力表现。
Rogo 在 Vercel 上重构其内部应用,实现了智能体编写的代码在 5 分钟内即可部署至生产环境。该团队利用 AI SDK 上的智能体群,在生产事故中实现零人工干预的自动诊断与修复,每月部署次数超过 73,000 次。
一种基于 Amazon Bedrock AgentCore 的四智能体模式,将单个应用的基础设施即代码开发时间从 3-4 周缩短至分钟级。该模式与 AWS Transform 和 AWS DMS 等托管服务协同工作,通过 Model Context Protocol 工具连接组织内部系统,并包含 Intake、IaC、迁移治理及 SRE 四个专用智能体。
12 个 LLM 智能体在三个领域任务中均表现出对特定来源的显著偏好,即使来源较差的项目仍因来源偏好被选中约三分之二时间;隐藏来源信息可削弱偏好,而将项目重标为偏好来源可提升其被选中率;通过补全缺失信息或使用反偏见提示可有效降低来源偏好。
Skill2Real 提出一种基于智能体的策略框架,通过共享 API 学习可执行技能,利用 Proposer-Verifier-Governor 循环在仿真中诊断与验证更新,保持技能与公共观测及 API 语义一致。
推荐理由:该研究提出通过共享 API 实现零样本仿真到现实的机器人操作技能迁移,验证了框架在真实场景中的有效性。
NVIDIA 为 DOCA 软件平台引入了 Agent Skills,使 AI 智能体能够理解并操作 BlueField DPU 的专用基础设施。这些技能让智能体能够生成准确的配置代码,减少开发过程中的猜测和修正周期,从而加速应用部署。
NVIDIA NeMo Agent Toolkit (NAT) 可通过自定义插件将 Amazon S3 Vectors 集成为持久化记忆后端。该实现利用 Amazon Titan Text Embeddings V2 生成嵌入向量,并支持基于元数据的过滤和强一致性写入。此方案为需要弹性扩展至数十亿向量、具备成本效益的多智能体生产系统提供了记忆层。
Amazon Bedrock AgentCore 平台支持构建响应事件流的环境智能体,通过内置的 `ask_human` 工具在需要时暂停以获取人工输入。该平台利用 AWS Lambda 进行事件处理,并集成 Anthropic Claude Sonnet 4.5 等基础模型,提供基于容器的执行环境以支持长时间运行的工作负载。
WRITER 提出了名为“Agentic Compact”的框架,主张企业级智能体 AI 的透明度需从底层大语言模型延伸至整个运行系统。该框架强调,除了模型透明度(如 Palmyra X5 在斯坦福透明度指数中获 72 分外),企业还需关注围绕模型的指令、工具、权限、护栏以及塑造其行为的上下文。透明度应提供从模型选择到最终输出全链条的可见性,以支持明智决策并保持控制。
Cloudflare 发布其训练的开源决策模型 Clef 和 Clef-flash,并推出新的强化学习微调平台。Clef 模型在 Jev Decision Index 基准测试中领先,支持 64k 上下文窗口和视觉编码,并托管于 Workers AI 以降低延迟。模型已在 Hugging Face 以 Apache 2.0 许可证开源。
推荐理由:原文提供了决策模型的具体能力、基准测试结果和微调平台细节,读者可以据此评估它如何提升智能体工作流的效率和确定性。
Arize AI 的 Alyx 智能体采用每用户每空间一个结构化文本文件作为长时记忆,文件大小限制为8000字符,每次请求加载全文。该设计避免了检索和知识图谱的高成本,通过后台任务总结对话并精确编辑文件,同时使用安全检查防止注入。
推荐理由:原文对比了知识图谱与文件式记忆架构,给出了具体设计选择和评估方法,读者可据此判断在限定场景下如何权衡成本与效果。
Alyx 现在支持长期记忆功能,可在跨会话中保留项目目标、偏好和先前决策等有用上下文。该功能默认对所有 Arize AX 用户开放,记忆内容不共享给团队成员或跨空间,用户可通过聊天要求 Alyx 展示、修正或删除记忆。长期记忆帮助用户减少重复解释环境的步骤,提升在追踪、评估和实验中的工作效率。
Cloudflare OS 宣布开放全托管部署的候补名单,用户可通过仪表板快速启动组织专属的智能体工作空间。本次更新新增了连接 GitHub 仓库进行代码操作、改进 Google Workspace 集成以处理邮件和文档,以及支持将工作成果导出为 Excel、PDF 等多种格式的功能。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Graph-centric agentic intelligence 提出了一种基于图结构的智能体推理方法,用于网络中的根因分析。该方法结合了图算法与智能体 AI,实现了在商业网络中几分钟内完成根因分析。系统通过三个核心模块:图建模(数字孪生)、图中心分析(级联流水线)和智能体调度,处理来自多个数据源的网络依赖、实时警报和 KPI,形成拓扑感知的数据结构并进行推理。
Databricks 与 Lovelytics 合作,通过构建统一的客户身份与行为上下文,使 AI 智能体能更精准地推荐营销行动并证明其价值。Acxiom 的 Real ID 引擎已原生部署于 Databricks 平台,缩短了 30% 的洞察交付时间并降低 15% 的运营成本。客户、业务、决策和控制四类上下文的整合,为智能体提供更全面的信息支持,以实现更一致的营销效果衡量。
Jev 是 TypeSafe AI 发布的一种新型 System One 模型,用于在无需生成文本的情况下进行快速、结构化的决策,支持分类任务中高达 200 倍的推理速度和 400 倍的成本降低。
研究发现,在同等时间预算和前沿大语言模型骨干下,复杂的多智能体编排系统相比一个具备读写和bash原语的最小化编码智能体基线,在公开排行榜上并未展现出优势。大规模系统消融实验表明,在编码智能体场景中,复杂的“缰绳”层变得冗余。这表明,围绕强大模型精心设计手工“缰绳”的努力,在当前机器学习工程基准测试中回报甚微。
Vercel Agent 新增了从 npm 和自定义注册表安装私有依赖包的能力。该功能通过读取 Vercel 上配置的共享环境变量(如 NPM_TOKEN 或 NPM_RC)进行身份验证,且凭证值不会进入 Agent 沙箱。npm、pnpm 和经典 Yarn 在 Agent 会话中的认证方式与 Vercel 构建过程保持一致。
Hugging Face 推出 SciUtopia,一个基于大语言模型的闭环模拟框架,用于研究学术研究生态系统的动态演化过程。该框架模拟了超过 40,000 名研究人员、8,000 家机构的长期科研行为,生成约 40 万篇论文决策和 120 万条 LLM 生成的同行评审意见。