跳到正文
今天10月6日周二7 条
  1. AWS · AI 博客30

    Amazon Bedrock AgentCore 评估多智能体系统的可解释性与实用性

    Amazon Bedrock AgentCore 提供了一种全托管的评估能力,用于衡量多智能体系统在开发和生产环境中的准确性、任务成功率和行为表现。该平台支持内置评估器和自定义评估器,前者用于快速评估通用质量维度,后者用于验证供应链场景中的约束满足、路线可行性、SQL 正确性及可解释性。企业可通过此框架同时评估智能体响应的语言质量与业务决策的有效性。

  2. AWS · AI 博客35

    Agentic retrieval with LangChain and Amazon Bedrock Knowledge Bases

    Amazon Bedrock 管理知识库支持通过 AgenticRetrieveStream API 实现智能体式检索,将复杂问题拆解为多个子查询并逐步执行。与标准检索相比,该方法能更全面覆盖问题意图,但成本可能更高。文章演示了使用 LangChain 和 Amazon Bedrock 知识库构建 RAG 应用,并介绍了两种检索方式的权限配置及实现流程。

  3. AWS · AI 博客31

    Amazon Quick 如何实现跨账户资源推广的自动化

    Amazon Quick 通过 API 和 Model Context Protocol (MCP) 服务器实现跨账户资源推广的自动化,支持创建、读取、更新和删除操作。该方案可在单次调用中推广资源,保留权限并提供版本化备份,确保可审查和回滚。推广过程包括聊天代理、操作连接器、知识库、流程和空间的配置迁移,且不复制 S3 对象本身,仅重建数据源和权限。

  4. Databricks 博客26

    Genie Ontology 如何赋能 Databricks 产品开发

    Genie Ontology 通过整合企业内部的认证定义、规则和权威来源,使 Genie 能够在推理过程中准确理解业务上下文。它结合了 Unity Catalog 中的核心概念、组织内的仪表板、文档和查询数据,并利用 OntoRank 对上下文进行权威排序。

10月5日周一
  1. Cloudflare · AI48

    Cloudflare 在 2026 年生日周推出了多项新功能和工具

    Cloudflare 在 2026 年生日周推出了新的 agentic CLI、开源工具 Forge 和 EmDash 等项目。本周还发布了支持 WebMCP、更快 DOM 操作的 Kitesurf 浏览器更新,以及用于探索网站性能数据的 BEACON 工具。此外,Cloudflare 宣布将建立公共证书机构并推进后量子加密迁移,相关功能已开始在部分产品中展示。

10月4日周日
  1. Hugging Face Blog62

    Microsoft 与 Hugging Face 发布智能体评测基准 ThinkingBox

    Microsoft 与 Hugging Face 联合发布智能体评测基准 ThinkingBox,通过检查数据库最终状态和副作用而非工具调用来评估智能体。该研究在 507 个有状态工作流上对 12 个 LLM 模型进行了 20 次重复测试,发现模型的一次性成功率(pass@1)与始终正确率(20/20)之间存在巨大差距。

    推荐理由:该研究通过检查数据库最终状态而非工具调用来评估智能体,揭示了模型一次性成功与可靠执行之间的显著差距。

  2. Hugging Face · 每日论文43

    Code2Games:通过编码智能体实现游戏世界的生成

    Code2Games 是一个智能体框架,通过协调场景分析、游戏规划和引擎适配,从自然语言游戏意图生成结构一致的游戏世界。该框架基于 Blender 生成基础世界,并通过执行引导的重建过程提升 Unreal Engine 5 适配后的游戏质量。研究者引入了 GameCode4D 评测基准,从视觉质量、交互保真度等四个维度验证其效果,实验表明其在多个指标上优于现有方法。

  3. Hugging Face · 每日论文47

    ASCENT:通过验证经验的自蒸馏实现长时地平线智能体的在线测试时训练

    ASCENT 提出一种在线测试时训练方法,通过自蒸馏验证经验提升长时地平线智能体性能。该方法在部署过程中利用智能体执行轨迹中的验证结果,更新其 LoRA 快速权重,无需外部参考方案或更强教师模型。在 ALFWorld、WebShop 和 AppWorld 等基准上,ASCENT 随着经验积累提高了任务成功率和交互效率,并优于其他在线适应方法。

10月3日周六
  1. Databricks 博客34

    Databricks Genie One 如何兼顾前沿智能与效率

    Databricks Genie One 通过 AI 智能体在后台自动处理基金运营数据,生成可追溯的初步 NAV 数值。其结合实时数据和 Genie Ontology,确保财务数据在业务变化中保持准确与一致性。该系统能提升投资运营效率 55% 至 65%,并降低约 40% 的操作成本,适用于基金会计、对账和 NAV 管理等场景。

  2. Databricks 博客33

    如何选择首批 Genie Agents 以实现最大影响

    Databricks 提出一个基于五个核心变量的框架,用于评估和选择应优先构建的 Genie Agents。该框架通过业务影响、需求频率、数据就绪度、范围清晰度和治理风险匹配度对候选工作流进行 1-5 分评分,总分 20-25 分的工作流适合立即构建。一个活跃的高管支持者对于将高性能 Agent 转化为被广泛采用的工具至关重要。

10月2日周五
  1. GitHub Blog · AI & ML31

    AI 如何改变开发者工作:三项需强化的技能

    AI 正在改变开发者的工作方式,要求其掌握引导 AI 智能体而非仅使用工具、不盲信 AI 的首个答案并进行交叉审查,以及利用 AI 节省的时间去解决更宏观问题等三项关键技能。GitHub Copilot 内置的 Rubber Duck 智能体已采用第二模型来审查计划、代码和测试。开发者应将时间更多用于理解客户需求、评估权衡和做出 AI 无法替代的技术决策。

  2. Writer 博客28

    BetterHelp 首席增长官如何构建 AI 原生营销引擎

    BetterHelp 首席增长官 Sara Brooks 通过创建 AI Excellence 职能和采用 WRITER 平台,在公司内部构建了 AI 原生营销引擎。团队利用 WRITER 存储品牌资产并生成内容,开发了从策略到创意的端到端智能体化活动流程,并通过 A/B 测试验证了其效果。Sara 本人每日亲自使用 WRITER 工作流,以领导者的亲身实践推动团队采用 AI。

  3. LangChain 博客69

    LangChain 发布模型路由构建教程

    LangChain 在其开源编码代理 Open SWE 中实现模型路由,通过任务分析与模型分级匹配,将中位数成本降低64%且质量无明显下降。该教程详细说明了任务分类、模型选型、路由逻辑设计及效果验证方法,并提供可复用的中间件工具。

    推荐理由:原文给出了模型路由的构建步骤和实测效果,读者可直接复用其方法框架。

  4. Arize 博客65

    Claude 的智能体爬坡循环:从生产日志开始

    Arize 分析了 Anthropic 发布的 Claude hillclimb 方法,强调从生产日志构建评估集、混合代码和 LLM 评估器、优化成本与质量平衡,并通过 Arize AX 实现团队可复用的持续优化循环。

    推荐理由:原文结合生产日志和评估循环,展示了如何让智能体优化从个人实验转向团队可复现的持续流程。

  5. Hugging Face Blog47

    AutoSynthData:生成企业智能体训练数据的工具

    AutoSynthData 是 ServiceNow CoreAI 开发的工具,用于从企业智能体在特定环境中的失败案例生成训练数据。该工具结合目标模型的失败与更强教师模型的成功,生成符合环境约束、具有现实性和挑战性的任务。生成的任务包含系统规范、用户提示和验证器,用于提升模型在企业场景中的能力表现。

  6. AWS Machine Learning Blog38

    如何在 Amazon Bedrock AgentCore 上使用智能体 AI 扩展云迁移

    一种基于 Amazon Bedrock AgentCore 的四智能体模式,将单个应用的基础设施即代码开发时间从 3-4 周缩短至分钟级。该模式与 AWS Transform 和 AWS DMS 等托管服务协同工作,通过 Model Context Protocol 工具连接组织内部系统,并包含 Intake、IaC、迁移治理及 SRE 四个专用智能体。

  7. Hugging Face · 每日论文41

    LLM 智能体在真实场景中对来源存在偏好,且可通过信息补全或提示缓解

    12 个 LLM 智能体在三个领域任务中均表现出对特定来源的显著偏好,即使来源较差的项目仍因来源偏好被选中约三分之二时间;隐藏来源信息可削弱偏好,而将项目重标为偏好来源可提升其被选中率;通过补全缺失信息或使用反偏见提示可有效降低来源偏好。

  8. Hugging Face · 每日论文58

    Skill2Real:基于智能体的零样本仿真到现实机器人操作技能学习

    Skill2Real 提出一种基于智能体的策略框架,通过共享 API 学习可执行技能,利用 Proposer-Verifier-Governor 循环在仿真中诊断与验证更新,保持技能与公共观测及 API 语义一致。

    推荐理由:该研究提出通过共享 API 实现零样本仿真到现实的机器人操作技能迁移,验证了框架在真实场景中的有效性。

  9. AWS Machine Learning Blog46

    使用 NVIDIA NeMo Agent Toolkit 和 Amazon S3 Vectors 构建智能体记忆

    NVIDIA NeMo Agent Toolkit (NAT) 可通过自定义插件将 Amazon S3 Vectors 集成为持久化记忆后端。该实现利用 Amazon Titan Text Embeddings V2 生成嵌入向量,并支持基于元数据的过滤和强一致性写入。此方案为需要弹性扩展至数十亿向量、具备成本效益的多智能体生产系统提供了记忆层。

  10. AWS Machine Learning Blog45

    使用 Amazon Bedrock AgentCore 构建环境智能体:从事件驱动信号到人机协同工作流

    Amazon Bedrock AgentCore 平台支持构建响应事件流的环境智能体,通过内置的 `ask_human` 工具在需要时暂停以获取人工输入。该平台利用 AWS Lambda 进行事件处理,并集成 Anthropic Claude Sonnet 4.5 等基础模型,提供基于容器的执行环境以支持长时间运行的工作负载。

10月1日周四
  1. Writer 博客29

    WRITER 提出 Agentic Compact 框架,强调智能体 AI 的透明度需超越模型本身

    WRITER 提出了名为“Agentic Compact”的框架,主张企业级智能体 AI 的透明度需从底层大语言模型延伸至整个运行系统。该框架强调,除了模型透明度(如 Palmyra X5 在斯坦福透明度指数中获 72 分外),企业还需关注围绕模型的指令、工具、权限、护栏以及塑造其行为的上下文。透明度应提供从模型选择到最终输出全链条的可见性,以支持明智决策并保持控制。

  2. Cloudflare · AI69

    Cloudflare 发布开源决策模型 Clef 及 RL 微调平台

    Cloudflare 发布其训练的开源决策模型 Clef 和 Clef-flash,并推出新的强化学习微调平台。Clef 模型在 Jev Decision Index 基准测试中领先,支持 64k 上下文窗口和视觉编码,并托管于 Workers AI 以降低延迟。模型已在 Hugging Face 以 Apache 2.0 许可证开源。

    推荐理由:原文提供了决策模型的具体能力、基准测试结果和微调平台细节,读者可以据此评估它如何提升智能体工作流的效率和确定性。

  3. Arize 博客61

    Arize Alyx 智能体长时记忆架构:为何选择文件而非知识图谱

    Arize AI 的 Alyx 智能体采用每用户每空间一个结构化文本文件作为长时记忆,文件大小限制为8000字符,每次请求加载全文。该设计避免了检索和知识图谱的高成本,通过后台任务总结对话并精确编辑文件,同时使用安全检查防止注入。

    推荐理由:原文对比了知识图谱与文件式记忆架构,给出了具体设计选择和评估方法,读者可据此判断在限定场景下如何权衡成本与效果。

  4. Arize 博客38

    Alyx 现在能跨会话记住你的工作内容,支持长期记忆功能

    Alyx 现在支持长期记忆功能,可在跨会话中保留项目目标、偏好和先前决策等有用上下文。该功能默认对所有 Arize AX 用户开放,记忆内容不共享给团队成员或跨空间,用户可通过聊天要求 Alyx 展示、修正或删除记忆。长期记忆帮助用户减少重复解释环境的步骤,提升在追踪、评估和实验中的工作效率。

  5. Cloudflare · AI60

    Cloudflare OS 开放全托管部署候补名单并更新功能

    Cloudflare OS 宣布开放全托管部署的候补名单,用户可通过仪表板快速启动组织专属的智能体工作空间。本次更新新增了连接 GitHub 仓库进行代码操作、改进 Google Workspace 集成以处理邮件和文档,以及支持将工作成果导出为 Excel、PDF 等多种格式的功能。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  6. Amazon Science33

    Graph-centric agentic intelligence

    Graph-centric agentic intelligence 提出了一种基于图结构的智能体推理方法,用于网络中的根因分析。该方法结合了图算法与智能体 AI,实现了在商业网络中几分钟内完成根因分析。系统通过三个核心模块:图建模(数字孪生)、图中心分析(级联流水线)和智能体调度,处理来自多个数据源的网络依赖、实时警报和 KPI,形成拓扑感知的数据结构并进行推理。

  7. Databricks 博客26

    连接客户上下文与可衡量的 ROI:如何实现智能营销

    Databricks 与 Lovelytics 合作,通过构建统一的客户身份与行为上下文,使 AI 智能体能更精准地推荐营销行动并证明其价值。Acxiom 的 Real ID 引擎已原生部署于 Databricks 平台,缩短了 30% 的洞察交付时间并降低 15% 的运营成本。客户、业务、决策和控制四类上下文的整合,为智能体提供更全面的信息支持,以实现更一致的营销效果衡量。

  8. Apple · 机器学习研究45

    强智能体在自主机器学习工程中需要多少“缰绳”?

    研究发现,在同等时间预算和前沿大语言模型骨干下,复杂的多智能体编排系统相比一个具备读写和bash原语的最小化编码智能体基线,在公开排行榜上并未展现出优势。大规模系统消融实验表明,在编码智能体场景中,复杂的“缰绳”层变得冗余。这表明,围绕强大模型精心设计手工“缰绳”的努力,在当前机器学习工程基准测试中回报甚微。