跳到正文
9月25日周五
  1. Google Research56

    Google 发布多代理框架实现连贯长视频生成

    Google 研究团队提出 AI 视频协导演框架,基于 Gemini 和 Veo 构建统一多代理系统,通过全局优化、视觉记忆追踪、自回归生成与闭环质量评估,解决长视频生成中的语义漂移、特征漂移和内容坍缩问题。

    推荐理由:原文系统性地提出了多代理框架解决长视频生成中的连贯性问题,提供了可复现的技术路径和基准测试结果。

  2. LangChain 博客41

    LangSmith Engine v2 新增红队测试与自动化检测功能

    LangSmith Engine v2 引入红队测试功能,用于主动发现智能体在生产环境中的潜在问题,如幻觉和系统提示违规。该版本可检测更隐蔽的性能问题,如延迟和成本趋势,并在提交修复前自动验证其有效性。目前红队测试功能已向现有 LangSmith 部署用户开放私有测试,支持 SaaS 部署的 Plus 和 Enterprise 计划用户可立即启用。

9月24日周四
  1. LangChain 博客43

    Managed Deep Agents 0.8 发布:新增用户级记忆、身份认证与多渠道支持

    Managed Deep Agents 0.8 新增用户级记忆、身份认证、HTTP 通道和 Slack 文件传输功能,支持更安全的生产环境代理运行。该版本通过 LangSmith Context Hub 提供持久化记忆存储,区分代理级和用户级上下文,防止信息泄露。用户可通过配置访问策略控制记忆使用范围,适用于客服、研究等多场景。

  2. Vercel 博客37

    Vercel Connect 现已支持 TanStack AI

    Vercel Connect 新增对 TanStack AI 的支持,允许其构建的智能体通过 OAuth 安全调用 MCP 服务器而无需管理凭证。新的 `@vercel/connect/tanstack-ai` 子路径导出 `connectMCPTransport` 函数,可在每次 MCP 请求前自动附加认证提供者以获取最新 token。

9月23日周三
  1. Vercel 博客42

    Vercel Sandbox 的 Drives 功能进入公开测试版

    Vercel Sandbox 的 Drives 功能已在 Hobby、Pro 和 Enterprise 计划中开放公开测试版。Drives 是一种持久存储,可作为目录挂载到沙盒中,用于保存 AI 智能体的工作区或磁盘记忆,并可跨不同沙盒实例复用。每个沙盒最多可挂载四个 Drives,默认最大容量为 1 TiB,并可配置至 16 TiB。

9月22日周二
  1. PyTorch 博客69

    Shopify 如何用 PyTorch 和 vLLM 构建持续学习循环

    Shopify 分享了其构建持续学习循环的完整方法,使专用模型在质量上超越前沿模型,同时将服务成本降低 96%。该方法始于定义质量评估标准并校准离线评估器,然后通过自动化研究优化提示和工具定义,再利用生产中的困难案例通过强化学习更新模型权重。

    推荐理由:Shopify 分享了从评估标准定义到模型压缩的完整工程实践,为构建持续学习系统提供了具体路径。

9月21日周一
9月18日周五
  1. GitHub Blog · AI & ML26

    GitHub Podcast 探讨 AI 开发中的热门观点:代码审查、RAG、Skills 与 MCP

    GitHub Podcast 最新一期探讨了关于 AI 辅助开发的几个常见热门观点。节目指出,开发者仍需审查 AI 生成的代码,但应根据风险调整审查深度;RAG 并未过时,它通过提供模型训练数据外的相关信息来提升回答质量;Skills 和 MCP 解决不同问题,前者是打包的专业知识,后者是连接工具与数据的标准协议,可在同一工作流中共存。

  2. Vercel 博客54

    Jev 成为 Vercel AI Gateway 历史上采用最快的模型

    Jev 在 Vercel AI Gateway 上线 24 小时内,付费团队使用率达到了 13%,是 GPT-5.6 家族的两倍多,Fable 5.1 的六倍多,成为该平台历史上采用最快的模型。Jev 是一款由 TypeSafe AI 推出的概率决策模型,专为软件内的结构化决策设计,可并行评估问题并返回带概率的答案,据称在自身工作流评估中比大语言模型快 194 倍、便宜 445 倍。

    推荐理由:原文提供了 Jev 在 Vercel AI Gateway 上的具体采用数据和性能对比,读者可以据此评估其市场接受度和技术定位。

  3. Vercel 博客50

    Vercel skills CLI 新增支持 Notion 托管技能

    Vercel skills CLI 1.7.0 版本新增支持从 Notion 页面安装智能体技能,用户可通过命令 npx skills add notion 浏览并安装共享的技能包,或直接传入 Notion 页面 URL 安装单个技能,依赖 Notion CLI 进行认证,技能权限由 Notion 页面权限控制。

  4. LangChain 博客42

    Included Health 如何用 LangGraph 和 Deep Agents 构建联邦医疗智能体

    Included Health 通过 LangGraph 和 Deep Agents 构建了一个联邦医疗智能体架构,用于其 AI 驱动的医疗导航平台 Dot。该架构允许智能体在不同子流程间保持语气和行为一致性,并通过共享文件系统传递上下文信息,避免用户重复说明。Deep Agents 还支持将临床能力封装为技能,供各智能体按需调用,提升对话的自然度和导航效率。

  5. LangChain 博客66

    LangChain 发布面向生命科学的开源智能体助手 Deep Life Sci

    LangChain 发布开源智能体助手 Deep Life Sci,支持访问 ClinicalTrials.gov、PubMed 和 PubMed Central 的超 600 万项临床试验记录与 4100 万篇文献,可并行处理文档并运行代码分析,提供可审计的全流程追踪与评估能力,适用于基因组学、临床试验数据提取与文档自动化等场景。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月17日周四
  1. Writer 博客27

    WRITER Agent 与 Palmyra X6 如何解决私募市场分销的个性化悖论

    WRITER 的 AI 智能体与 Palmyra X6 基础模型能帮助外部销售代表规模化处理个性化沟通。系统通过连接器整合 Salesforce 和 Outlook 数据,为每次会议生成个性化简报与后续跟进草稿,并内置合规审查功能。这解决了销售代表在管理数百名顾问时,因信息分散和准备时间不足而难以建立深度信任关系的挑战。

  2. Microsoft 官方博客38

    Microsoft 的 AI 变革实践:从工具使用到业务价值创造的五大经验

    Microsoft 通过自身 AI 变革实践,总结出五大经验,强调从业务目标出发而非单纯技术部署,实现销售团队成交率提升 20%、供应链流程周期缩短 75% 等成果。AI 被用于重新设计完整工作流,而非仅优化单个任务,例如部署超 100 个定制智能体以提升供应链决策效率。同时,Microsoft 将经验整理为 Frontier Playbook,作为帮助客户实现 AI 变革的实用指南。

  3. GitHub Blog · AI & ML70

    GitHub Copilot 运行时使用 Copilot 自身重写为 Rust

    GitHub Copilot 团队使用 GitHub Copilot 应用和 CLI,将 Copilot 智能体运行时从 TypeScript 完全重写为超过 80 万行生产级 Rust 代码。该项目主要由一名开发者在几个月内完成,性能提升了数个数量级,并支持通过 C ABI 进行进程内嵌入,为所有六种 SDK 语言版本提供了更优的性能和资源使用方案。

    推荐理由:原文详细记录了用 AI 辅助将核心运行时从 TypeScript 重写为 Rust 的完整过程、技术决策和量化结果,为大规模工程迁移提供了具体参考。

  4. Microsoft 新模型60

    Microsoft 发布 FrogNano-4B-2609 模型:基于 Qwen3.5-4B 的紧凑型代码智能体

    Microsoft 发布 FrogNano-4B-2609 模型,基于 Qwen/Qwen3.5-4B 架构,通过强化学习在约 1,500 个合成软件工程任务上训练,专用于仓库级代码智能体任务。

    推荐理由:原文详细说明了模型架构、训练方法、基准表现和使用限制,读者可据此判断其在代码智能体领域的定位与适用边界。

9月16日周三
  1. Neo4j 博客25

    图、知识图谱与上下文图谱:你需要哪一种?

    图用于展示数据中实体之间的关系,知识图谱在此基础上添加业务定义和组织原则以解释关系含义,上下文图谱则在特定任务或决策时提供相关背景信息。知识图谱可帮助统一企业数据视角并支持 AI 响应与业务逻辑对齐,而上下文图谱能提升 AI 智能体的决策准确性并减少幻觉。GraphRAG 则利用图技术从知识图谱或上下文图谱中检索关联信息,增强 AI 生成内容的相关性。

9月15日周二
  1. 上海 AI 实验室 新模型62

    上海 AI 实验室发布 Atria Dawn Preview 模型

    上海 AI 实验室发布新一代智能体模型 Atria Dawn Preview,基于 744B 参数 MoE GLM-5.2 基座,支持 256K 上下文窗口,专注于科研与工程场景中的环境理解、工具调用和多步任务完成。

    推荐理由:原文提供了模型架构、评测基准和部署方式,读者可以据此判断其在科研与工程场景中的实际应用潜力。

  2. LangChain 博客55

    LangChain 发布付费媒体智能体并开源

    LangChain 发布用于管理付费广告的智能体,支持跨平台数据整合、自动分析与提案,已开源并可通过 Managed Deep Agents 部署至 Slack。该智能体在六个月内使付费媒体贡献营销管道比例从 0 提升至 20%,成本下降 30%,并实现了 40 倍的报告生成效率提升。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月14日周一
  1. LangChain 博客61

    LangChain 发布 GTM 智能体功能

    LangChain 发布 GTM 智能体,可自动处理新线索的调研与邮件草稿生成,并聚合账户级信号以支持销售与工程团队。该功能基于 Deep Agents 构建,支持多工具协同、人类审核、学习反馈循环,并已集成至 Slack 与 LangSmith。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  2. LangChain 博客61

    LangChain 推出 Managed Deep Agents 的连接管理功能

    LangChain 在 Managed Deep Agents 中推出 Connections 功能,支持管理凭据和按调用者身份识别。连接分为代理所有(agent-owned)和用户所有(user-owned)两种,前者共享凭据用于通用工具如 Tavily 搜索,后者通过 OAuth 实现用户级身份,支持 GitHub、Linear 等服务。

    推荐理由:原文给出了连接管理的三种模式和代码调用方式,读者可以据此判断如何在智能体中实现安全的凭据分离与用户身份识别。

9月12日周六
9月11日周五
  1. Writer 博客35

    AI 原生营销的三支柱:为何生产力仅是基线

    AI 原生营销建立在三个战略支柱之上:在不断变化的客户旅程中保持可见性、在嘈杂市场中实现差异化以及持续编排。生产力只是实现这些优势的基线,仅能创造容量而非竞争优势。根据 WRITER 的框架,AI 驱动的工作流可处理 80% 的战术工作,而 Forrester Consulting 的研究显示,采用该框架的复合组织实现了 333% 的投资回报率,投资回收期不到 6 个月。

9月10日周四
9月9日周三
  1. Writer 博客32

    WRITER 推出 Enterprise Brain:共享的 GTM 上下文层

    WRITER 推出名为 Enterprise Brain 的共享上下文系统,旨在为整个营销和收入组织的 AI 智能体提供公司品牌、客户和市场策略知识。该系统智能捕获团队工作中学到的决策、客户信号以及公司既定的品牌指南、合规要求等两类关键上下文,并将其转化为智能体可用的共享基础。

  2. Mistral AI48

    Mistral AI 如何用智能体现代化复杂遗留代码

    Mistral AI 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 代码迁移至 C++,并重构了物理密集型的油藏模拟器架构。项目首先构建了数值对等性验证框架,确保新旧代码输出一致,并利用上百个 AI 智能体自动解析代码调用树、整合分散文档。通过采用“规划-编码-测试-评审”的多智能体工作流与人机协同检查点,最终在保障代码质量的同时完成了现代化重构。

  3. Neo4j 博客42

    决策轨迹在上下文图中是什么?它们如何揭示智能体的推理过程

    决策轨迹记录了AI智能体在做出决策时的推理步骤、工具调用和上下文信息,使决策过程可追溯和可查询。这些信息存储在上下文图中,与对话、事实和其他相关数据保持连接,便于后续审查和分析。决策轨迹支持可解释性、调试、合规审查、一致性提升和跨智能体的知识共享。