跳到正文
9月23日周三
  1. The Pragmatic Engineer49

    Windows 如何应对 AI 时代?微软计划引入更多智能体工具支持

    微软正在为 Windows 操作系统引入更多对智能体工具的支持,包括本地运行 AI 模型、隔离智能体工具和嵌入 Linux 子系统(WSL)。WindowsML 作为新的硬件抽象层,将支持在 GPU、NPU 和 CPU 上运行本地模型,未来甚至可在无 NPU 的设备上运行小型语言模型(SLMs)。同时,微软正通过改进开发者体验,试图吸引因历史产品决策而流失的开发者回归。

9月22日周二
  1. IEEE Spectrum · AI67

    Paper2Agent:将科研论文转化为可交互AI智能体的开源工具

    Paper2Agent是一个开源框架,可将学术论文及其代码、数据自动转化为可交互的AI智能体。该系统在无人工干预下,45分钟内生成22个可验证的分析工具,并通过测试代理确保功能正确。

    推荐理由:原文展示了将科研论文自动转化为可交互AI智能体的完整流程,读者可直接复用该方法提升研究可复现性。

  2. PyTorch 博客69

    Shopify 如何用 PyTorch 和 vLLM 构建持续学习循环

    Shopify 分享了其构建持续学习循环的完整方法,使专用模型在质量上超越前沿模型,同时将服务成本降低 96%。该方法始于定义质量评估标准并校准离线评估器,然后通过自动化研究优化提示和工具定义,再利用生产中的困难案例通过强化学习更新模型权重。

    推荐理由:Shopify 分享了从评估标准定义到模型压缩的完整工程实践,为构建持续学习系统提供了具体路径。

9月21日周一
  1. AI Business32

    加速 AI 采用与治理,尽管存在 AI 减速呼吁

    企业正加快 AI 部署,尽管 AI 前沿实验室呼吁减速,多数企业更关注治理而非减缓使用。OneTrust 报告指出,尽管过去一年出现 IP 泄露和 AI 智能体处理数据等问题,企业仍在推动 AI 应用。治理架构需独立于 AI 系统,以确保控制其行为,同时面对模型和工具碎片化带来的复杂性,企业需设计固定控制点以实施适当的安全策略。

  2. The Zvi28

    Better Call Sol 或 Better Yet Claude 或 Astra

    Better Call Sol 或 Better Yet Claude 或 Astra 探讨了 AI 律师在何种程度上应忠于用户的问题,指出 AI 不应完全无条件忠诚,而应考虑道德、法律等约束。文章强调,现实中的律师、医生等专业人士也并非完全忠诚于客户,而是有职业伦理限制。文中提到,若 AI 仅作为工具使用,其行为也受预设规则和法律限制,例如 Google 搜索会拒绝某些非法或有害请求。

9月19日周六
  1. Interconnects33

    Why I still haven’t bought into true RSI

    作者认为当前对真正递归自我改进(RSI)的担忧被夸大,指出短期内AI进步的加速主要来自推理能力的扩展,而非RSI本身。GPT-6-Astra预测,AI在1年内可胜任远程办公任务,3年内具备全面通用性,但存在在线学习和任务长尾的不确定性。作者强调,现有技术虽能解决已知问题,但难以实现对未知复杂问题的泛化,且AI安全社区对时间线的预测多基于推测而非事实。

  2. One Useful Thing47

    GPT-6 Astra 和 Fable 5.1 展示出超越预期的创作能力

    GPT-6 Astra 和 Fable 5.1 被用于将 1977 年文字冒险游戏 Zork 转换为 3D 动作冒险游戏,并重建意大利作家翁贝托·埃科的图书馆。AI 在无明确指令下使用 Blender 生成动画场景、脚本、音效并制作预告片,仅耗时 45 分钟。这些任务原本需要人类数周时间,展示了当前模型已具备显著的判断力和创造力,但其能力尚未被广泛利用。

9月18日周五
  1. GitHub Blog · AI & ML26

    GitHub Podcast 探讨 AI 开发中的热门观点:代码审查、RAG、Skills 与 MCP

    GitHub Podcast 最新一期探讨了关于 AI 辅助开发的几个常见热门观点。节目指出,开发者仍需审查 AI 生成的代码,但应根据风险调整审查深度;RAG 并未过时,它通过提供模型训练数据外的相关信息来提升回答质量;Skills 和 MCP 解决不同问题,前者是打包的专业知识,后者是连接工具与数据的标准协议,可在同一工作流中共存。

  2. AI Business31

    企业 AI 正在成为运营问题

    企业 AI 的部署正从技术挑战转向运营挑战,需决定不同模型如何分配任务并持续管理。Deluxe 公司使用超过 50 个 AI 智能体,并通过集中网关分配请求,考虑质量、风险、速度和成本等因素。同时,72% 的 AI 决策者指出,数据基础薄弱是企业 AI 项目失败的主要原因。

  3. Vercel 博客54

    Jev 成为 Vercel AI Gateway 历史上采用最快的模型

    Jev 在 Vercel AI Gateway 上线 24 小时内,付费团队使用率达到了 13%,是 GPT-5.6 家族的两倍多,Fable 5.1 的六倍多,成为该平台历史上采用最快的模型。Jev 是一款由 TypeSafe AI 推出的概率决策模型,专为软件内的结构化决策设计,可并行评估问题并返回带概率的答案,据称在自身工作流评估中比大语言模型快 194 倍、便宜 445 倍。

    推荐理由:原文提供了 Jev 在 Vercel AI Gateway 上的具体采用数据和性能对比,读者可以据此评估其市场接受度和技术定位。

  4. AI Business24

    AI 改变 ROI 计算方式。这里是如何实现的

    Alight Solutions 通过 Phenom 的欺诈检测招聘智能体在测试中发现一名重复申请的候选人,验证了 AI 在招聘环节的实用价值。该智能体虽未直接带来金钱节省,但显著提升了效率,节省了不必要的背景调查时间。OBI Creative 等企业则通过 Agentic AI 工具实现跨行业服务扩展,并提升毛利和年增长率。

  5. Vercel 博客50

    Vercel skills CLI 新增支持 Notion 托管技能

    Vercel skills CLI 1.7.0 版本新增支持从 Notion 页面安装智能体技能,用户可通过命令 npx skills add notion 浏览并安装共享的技能包,或直接传入 Notion 页面 URL 安装单个技能,依赖 Notion CLI 进行认证,技能权限由 Notion 页面权限控制。

  6. LangChain 博客42

    Included Health 如何用 LangGraph 和 Deep Agents 构建联邦医疗智能体

    Included Health 通过 LangGraph 和 Deep Agents 构建了一个联邦医疗智能体架构,用于其 AI 驱动的医疗导航平台 Dot。该架构允许智能体在不同子流程间保持语气和行为一致性,并通过共享文件系统传递上下文信息,避免用户重复说明。Deep Agents 还支持将临床能力封装为技能,供各智能体按需调用,提升对话的自然度和导航效率。

  7. LangChain 博客66

    LangChain 发布面向生命科学的开源智能体助手 Deep Life Sci

    LangChain 发布开源智能体助手 Deep Life Sci,支持访问 ClinicalTrials.gov、PubMed 和 PubMed Central 的超 600 万项临床试验记录与 4100 万篇文献,可并行处理文档并运行代码分析,提供可审计的全流程追踪与评估能力,适用于基因组学、临床试验数据提取与文档自动化等场景。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月17日周四
  1. Writer 博客27

    WRITER Agent 与 Palmyra X6 如何解决私募市场分销的个性化悖论

    WRITER 的 AI 智能体与 Palmyra X6 基础模型能帮助外部销售代表规模化处理个性化沟通。系统通过连接器整合 Salesforce 和 Outlook 数据,为每次会议生成个性化简报与后续跟进草稿,并内置合规审查功能。这解决了销售代表在管理数百名顾问时,因信息分散和准备时间不足而难以建立深度信任关系的挑战。

  2. Microsoft 官方博客38

    Microsoft 的 AI 变革实践:从工具使用到业务价值创造的五大经验

    Microsoft 通过自身 AI 变革实践,总结出五大经验,强调从业务目标出发而非单纯技术部署,实现销售团队成交率提升 20%、供应链流程周期缩短 75% 等成果。AI 被用于重新设计完整工作流,而非仅优化单个任务,例如部署超 100 个定制智能体以提升供应链决策效率。同时,Microsoft 将经验整理为 Frontier Playbook,作为帮助客户实现 AI 变革的实用指南。

  3. The Pragmatic Engineer43

    AI Skills with Matt Pocock

    Matt Pocock 讨论了他开发的“grill-me”技能,该技能通过持续提问用户来帮助 AI 智能体深入理解任务。他提到该技能灵感来自 Anthropic 的 Thariq Shihipar,并强调使用“tracer bullets”等引导性术语可提升智能体编码效果。摘要还提到他将编码流程转向云智能体以实现协作,并探讨了代码库需为“无记忆同事”优化的开发理念。

  4. GitHub Blog · AI & ML70

    GitHub Copilot 运行时使用 Copilot 自身重写为 Rust

    GitHub Copilot 团队使用 GitHub Copilot 应用和 CLI,将 Copilot 智能体运行时从 TypeScript 完全重写为超过 80 万行生产级 Rust 代码。该项目主要由一名开发者在几个月内完成,性能提升了数个数量级,并支持通过 C ABI 进行进程内嵌入,为所有六种 SDK 语言版本提供了更优的性能和资源使用方案。

    推荐理由:原文详细记录了用 AI 辅助将核心运行时从 TypeScript 重写为 Rust 的完整过程、技术决策和量化结果,为大规模工程迁移提供了具体参考。

  5. Microsoft 新模型60

    Microsoft 发布 FrogNano-4B-2609 模型:基于 Qwen3.5-4B 的紧凑型代码智能体

    Microsoft 发布 FrogNano-4B-2609 模型,基于 Qwen/Qwen3.5-4B 架构,通过强化学习在约 1,500 个合成软件工程任务上训练,专用于仓库级代码智能体任务。

    推荐理由:原文详细说明了模型架构、训练方法、基准表现和使用限制,读者可据此判断其在代码智能体领域的定位与适用边界。

  6. TLDR AI24

    Claude Cowork 与 Chat 合并,ChatGPT 推出赞助智能体,Harness Tax 引发讨论

    Claude Cowork 与 Chat 合并,用户可直接在 Claude 中编辑文档和演示并下载为 PowerPoint 或 PDF。OpenAI 推出 ChatGPT 赞助智能体功能,允许用户通过点击广告与企业赞助的智能体对话。Harness Tax 的研究指出,模型在任务成功率上受 harness 影响较小,但成本差异显著,强调了独立评估者的重要性。

9月16日周三
  1. Neo4j 博客25

    图、知识图谱与上下文图谱:你需要哪一种?

    图用于展示数据中实体之间的关系,知识图谱在此基础上添加业务定义和组织原则以解释关系含义,上下文图谱则在特定任务或决策时提供相关背景信息。知识图谱可帮助统一企业数据视角并支持 AI 响应与业务逻辑对齐,而上下文图谱能提升 AI 智能体的决策准确性并减少幻觉。GraphRAG 则利用图技术从知识图谱或上下文图谱中检索关联信息,增强 AI 生成内容的相关性。

9月15日周二
  1. The Pragmatic Engineer73

    OpenAI 内部智能体驱动的软件工厂:Codex 如何重塑工程实践

    Gergely Orosz 访谈 OpenAI 七位工程负责人,揭示 Codex 已成为公司核心工具,非工程团队使用率从 0% 升至 90%,并构建了包含自动代码生成、智能体代码审查、部署与监控的‘智能体软件工厂’。

    推荐理由:原文通过实地访谈和流程图展示了 OpenAI 如何用 Codex 构建智能体驱动的软件工厂,读者可借此理解 AI 工具如何重塑工程实践。

  2. 上海 AI 实验室 新模型62

    上海 AI 实验室发布 Atria Dawn Preview 模型

    上海 AI 实验室发布新一代智能体模型 Atria Dawn Preview,基于 744B 参数 MoE GLM-5.2 基座,支持 256K 上下文窗口,专注于科研与工程场景中的环境理解、工具调用和多步任务完成。

    推荐理由:原文提供了模型架构、评测基准和部署方式,读者可以据此判断其在科研与工程场景中的实际应用潜力。

  3. LangChain 博客55

    LangChain 发布付费媒体智能体并开源

    LangChain 发布用于管理付费广告的智能体,支持跨平台数据整合、自动分析与提案,已开源并可通过 Managed Deep Agents 部署至 Slack。该智能体在六个月内使付费媒体贡献营销管道比例从 0 提升至 20%,成本下降 30%,并实现了 40 倍的报告生成效率提升。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  4. AI Business36

    AI Harness 如何协调企业智能体与系统交互

    AI Harness 用于协调多个 AI 智能体与企业系统的交互,并在智能体执行操作前实施控制。它在多智能体协作场景中提供路由、访问控制和审计功能。企业通常在需要多个智能体协同工作或其操作需更多监管时才需要 AI Harness。

9月14日周一
  1. IEEE Spectrum · AI64

    Andon Labs 用AI智能体管理真实商业以测试其能力边界

    Andon Labs 在旧金山和斯德哥尔摩运营由AI智能体管理的真实商店和咖啡馆,测试其在真实世界中的自主管理能力。这些实验基于Anthropic、Google和OpenAI的模型,发现智能体常出现记忆丢失、过度纠正、误判环境等问题,且员工和顾客接受度低。

    推荐理由:原文通过真实商业实验揭示了AI智能体在现实管理中的局限,读者可借此理解当前AI能力与实际应用之间的差距。

  2. LangChain 博客61

    LangChain 发布 GTM 智能体功能

    LangChain 发布 GTM 智能体,可自动处理新线索的调研与邮件草稿生成,并聚合账户级信号以支持销售与工程团队。该功能基于 Deep Agents 构建,支持多工具协同、人类审核、学习反馈循环,并已集成至 Slack 与 LangSmith。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  3. LangChain 博客61

    LangChain 推出 Managed Deep Agents 的连接管理功能

    LangChain 在 Managed Deep Agents 中推出 Connections 功能,支持管理凭据和按调用者身份识别。连接分为代理所有(agent-owned)和用户所有(user-owned)两种,前者共享凭据用于通用工具如 Tavily 搜索,后者通过 OAuth 实现用户级身份,支持 GitHub、Linear 等服务。

    推荐理由:原文给出了连接管理的三种模式和代码调用方式,读者可以据此判断如何在智能体中实现安全的凭据分离与用户身份识别。

9月12日周六
9月11日周五
  1. Writer 博客35

    AI 原生营销的三支柱:为何生产力仅是基线

    AI 原生营销建立在三个战略支柱之上:在不断变化的客户旅程中保持可见性、在嘈杂市场中实现差异化以及持续编排。生产力只是实现这些优势的基线,仅能创造容量而非竞争优势。根据 WRITER 的框架,AI 驱动的工作流可处理 80% 的战术工作,而 Forrester Consulting 的研究显示,采用该框架的复合组织实现了 333% 的投资回报率,投资回收期不到 6 个月。