跳到正文
9月28日周一
  1. Cloudflare · AI53

    Cloudflare 发布 Kitesurf 浏览器更新,支持 WebMCP 并优化智能体效率

    Cloudflare 为其专为 AI 智能体设计的浏览器 Kitesurf 发布更新,新增对 WebMCP 的支持,使智能体能直接调用网站功能。Kitesurf 还扩展了支持的 Web API,通过了超过 73 万项 Web Platform Tests 子测试,并针对智能体循环延迟进行了内部引擎优化。该浏览器现已完全支持 Browser Run API,并推出了可在终端中运行的版本。

  2. LangChain 博客39

    LangSmith 推出自定义应用:围绕智能体数据构建专属界面

    LangSmith 推出自定义应用功能,允许用户基于其智能体数据构建、发布和运行专属界面,无需自行处理托管、认证和权限问题。该功能支持通过聊天提示或代码构建,Plus 和 Enterprise 计划用户可直接在 LangSmith Chat 中指定数据展示方式和可视化需求,生成可运行的应用。自定义应用可与 LangSmith 数据保持连接,用于重复性评审流程,提升人工反馈和实验对比的效率。

  3. LangChain 博客55

    LangChain 发布 Engine v2、Managed Deep Agents v0.8 等多项更新

    LangChain 发布 Engine v2,支持主动红队测试、自动验证修复方案并提升问题检测能力;推出 Managed Deep Agents v0.8,新增用户级内存。

    推荐理由:原文给出了 Engine v2 的自动化修复能力、Deep Agents 的用户级内存和 Web 搜索功能,读者可据此评估其对生产级 Agent 开发的影响。

  4. LangChain 博客62

    LangChain发布Jev与LangGraph协同构建生产级智能体

    LangChain联合TypeSafe AI发布Jev决策模型,与LangGraph协同构建生产级智能体。Jev在结构化决策任务上比主流LLM快200倍、便宜400倍,支持并行、可预测、自一致的判断输出。

    推荐理由:原文给出了Jev与LangGraph结合使用的方法和性能对比,读者可据此评估其在生产系统中的部署价值。

  5. NVIDIA 新闻室61

    NVIDIA 发布开放智能体安全平台,整合 OpenShell 与 Sentry 实现全栈安全控制

    NVIDIA 发布开放智能体安全平台,包含开源软件 OpenShell 和参考系统设计 Sentry,实现从测试到部署的全栈安全控制。OpenShell 在 NVIDIA Vera CPU 上提供安全运行边界,Sentry 通过 BlueField-4 DPU 实现毫秒级行为监控与隔离。

    推荐理由:原文给出了平台组成、硬件协同机制和生态合作方,读者可以据此判断它如何实现跨栈安全控制。

9月26日周六
  1. Hugging Face · 每日论文35

    用 Jev 决策模型替代大语言模型以实现低延迟边缘服务编排

    Jev 决策模型在边缘服务编排中替代大语言模型,将中位决策延迟降低 22.7-64.5%。其延迟几乎不受输入规模、合同宽度或目录规模影响,在四字段合同中每项正确决策的 API 费用降低 59.7-80.9%,但精确匹配点略有下降。Jev 能准确识别未见过的服务,并在实时准入路径中保持 0.91-0.95 的请求准确率和准时率,而大语言模型在同等负载下低于 0.1。

9月25日周五
  1. Amazon Science36

    Reactor 与 Amazon Neuron Science 团队合作实现 Trainium 上实时视频生成的内核优化路径

    Reactor 与 Amazon Neuron Science 团队合作,通过内核优化策略在 Trainium 上实现世界模型的实时视频生成。他们采用 Rolling Forcing 技术,该技术能以 16 帧每秒的速率生成高质量视频,满足实时播放需求。此次优化结合了世界模型的长序列生成能力与 Trainium 的高性能计算和内存支持,为未来实时视频生成模型提供了基础。

  2. Cloudflare · AI50

    Cloudflare 推出 Turnstile Spin,支持 AI 智能体自动配置网站安全验证

    Cloudflare 推出 Turnstile Spin,让 AI 智能体能够自动完成 Turnstile 验证系统的端到端部署。该功能可将原本需要前后端分别配置的两步流程,简化为由智能体引导的自动化工作流,支持全新安装、修复未验证的组件以及从其他 CAPTCHA 迁移。自 7 月发布以来,已成功创建超过 65,000 个 Spin widget。

  3. GitHub Blog · AI & ML38

    GitHub Copilot 如何用 canvases 构建交互体验

    GitHub Copilot 应用引入了名为“canvas”的全栈应用界面,以替代传统的聊天交互方式。canvases 能在应用内运行,实现与 Copilot 智能体的双向通信,并能调用第三方 API 或本地执行代码。这种可定制的 UI 旨在将用户从繁琐的聊天交互中解放出来,更高效地完成特定任务,例如构建游戏或自动化开发工作流。

  4. LangChain 博客41

    LangSmith Engine v2 新增红队测试与自动化检测功能

    LangSmith Engine v2 引入红队测试功能,用于主动发现智能体在生产环境中的潜在问题,如幻觉和系统提示违规。该版本可检测更隐蔽的性能问题,如延迟和成本趋势,并在提交修复前自动验证其有效性。目前红队测试功能已向现有 LangSmith 部署用户开放私有测试,支持 SaaS 部署的 Plus 和 Enterprise 计划用户可立即启用。

9月24日周四
  1. LangChain 博客68

    LangChain 发布 LangSmith Fine-Tuning 工具

    LangChain 发布 LangSmith Fine-Tuning 及其 CLI 工具 smithtune,支持从 LangSmith 轨迹数据中自动构建训练集、使用 Fireworks 或 Baseten 进行 LoRA 微调,并在 LangSmith 中评估模型性能。该工具专为后训练优化设计,支持监督微调(SFT),可提升模型在特定任务上的表现,同时降低推理成本与延迟。

    推荐理由:原文给出了从数据到训练再到部署的完整流程,读者可以据此评估其对开发效率的影响。

  2. LangChain 博客43

    Managed Deep Agents 0.8 发布:新增用户级记忆、身份认证与多渠道支持

    Managed Deep Agents 0.8 新增用户级记忆、身份认证、HTTP 通道和 Slack 文件传输功能,支持更安全的生产环境代理运行。该版本通过 LangSmith Context Hub 提供持久化记忆存储,区分代理级和用户级上下文,防止信息泄露。用户可通过配置访问策略控制记忆使用范围,适用于客服、研究等多场景。

  3. NVIDIA · 开发者博客35

    NVIDIA 指南:在 AI 工作负载部署前验证 GPU 集群就绪状态

    NVIDIA 发布指南,强调在 AI 工作负载实际部署前验证 GPU 集群就绪状态的重要性。即使所有 GPU、网络链路和容器都报告健康,一个 512-GPU 的训练任务仍可能因单个慢速 GPU 或链路在负载下性能下降而失败。该指南旨在帮助运维人员提前发现潜在问题,避免任务在运行数小时后才遭遇性能不佳或失败。

  4. GitHub Blog · AI & ML34

    GitHub Copilot 应用如何渲染超大型 Pull Request

    GitHub Copilot 应用重构了 Pull Request 视图,以应对包含 2200 个文件、超百万行更改和 400 多条行内评论的极端大型代码审查场景。新架构将文档高度拆分为确定性的代码几何与动态区块几何两部分,解决了评论内容高度不可预测导致的滚动跳跃问题。通过虚拟化、惰性测量和独立几何管理,确保了即使在超大规模差异和对话下,审查体验依然快速流畅。

  5. Microsoft Research49

    Microsoft Research 研究:为物理 AI 机器人卸载推理可提升性能与续航

    Microsoft Research 的研究表明,将物理 AI 机器人的推理任务从机载 GPU 卸载到边缘或云端,能显著提升任务成功率并延长电池续航。在移动操作任务中,卸载推理使障碍物及时检测率提升30%,并将机器人手臂交接物体的成功率提高了50%。该研究还引入了基于 Kubernetes 的工具集,用于在机器人、边缘和云端之间容器化与编排 AI 工作负载。

9月23日周三
  1. Neo4j 博客29

    审计 AWS 基础设施时,资源清单无法回答的问题

    本文探讨了使用 Neo4j 建立图模型以回答 AWS 基础设施审计中资源清单无法处理的问题,如账户间可达性与隔离性。AWS Config 提供了配置数据和关系块,可用于构建包含 12 种节点类型和特定关系类型的图。该图模型通过区分节点类型和关系标签,帮助智能体每日重新推导合规性结论。

  2. Neo4j 博客34

    Neo4j 推出重评分二进制向量搜索:用更少内存实现更高效检索

    Neo4j 2026.09 版本引入重评分二进制向量搜索,相比 2026.08 版本,检索吞吐量提升约 5 倍,查询延迟也更优。该技术通过使用高度压缩的二进制量化向量进行初步搜索,再用完整精度向量进行重评分,显著降低内存占用。在 768 维 Float32 嵌入向量场景下,相同内存预算下可存储的向量数量约为之前标量量化(8 位)的 4 倍。

  3. Together AI57

    如何用 17 美元训练自己的 Jev 分类模型

    Together AI 发布教程,指导用户用 Qwen3.5 4B 作为基础模型,通过 38,000 个示例数据集微调出类似 Jev 的分类模型,成本仅 17 美元。教程包含数据集选择、数据标准化、模型训练和部署到 API 端点的完整流程,最终模型可处理客户支持意图识别等分类任务。

    推荐理由:详细展示了如何用 17 美元和 25 分钟训练一个分类模型,包含数据集选择和部署步骤。

  4. Vercel 博客42

    Vercel Sandbox 的 Drives 功能进入公开测试版

    Vercel Sandbox 的 Drives 功能已在 Hobby、Pro 和 Enterprise 计划中开放公开测试版。Drives 是一种持久存储,可作为目录挂载到沙盒中,用于保存 AI 智能体的工作区或磁盘记忆,并可跨不同沙盒实例复用。每个沙盒最多可挂载四个 Drives,默认最大容量为 1 TiB,并可配置至 16 TiB。

  5. LangChain 博客30

    The Reliability Layer for Healthcare AI: Common LangSmith Use Cases

    两家医疗AI组织使用 LangSmith 将临床专家判断转化为可复用的评估资产,以提升系统准确性并减少人工审核负担。他们通过构建标注数据集、校准评估器和自动化发布门禁,使专家意见在多个测试和迭代中持续生效。Abridge 采用参考无关和参考相关的评估方法,分别直接评分和对比特定医学场景的示例,兼顾广泛性和精确性。

9月22日周二
  1. PyTorch 博客52

    vLLM 引入硬件无关层以支持多样化硬件和模型

    vLLM 正在引入一套新的硬件无关层,旨在确保项目在追求前沿 GPU 性能的同时,能继续支持多样化硬件和模型。这套新层遵循可编译、可扩展、隔离和可移植四大设计原则,已在 transformers 后端中提供初步支持。在 NVIDIA H100 GPU 上的测试表明,其 token 吞吐量与原生实现相比差距在 3.4% 以内。

  2. PyTorch 博客69

    Shopify 如何用 PyTorch 和 vLLM 构建持续学习循环

    Shopify 分享了其构建持续学习循环的完整方法,使专用模型在质量上超越前沿模型,同时将服务成本降低 96%。该方法始于定义质量评估标准并校准离线评估器,然后通过自动化研究优化提示和工具定义,再利用生产中的困难案例通过强化学习更新模型权重。

    推荐理由:Shopify 分享了从评估标准定义到模型压缩的完整工程实践,为构建持续学习系统提供了具体路径。

  3. Vercel 博客56

    Vercel AI Gateway 上线 GPT-6 Sol 和 Luna 模型

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 模型现已在 Vercel AI Gateway 上线。GPT-6 Sol 适用于需要持续调查的复杂编码和智能体工作流,GPT-6 Luna 则是高吞吐量、重复性任务的高性价比选择。相比 GPT-5.6,两者在事实可靠性、沟通直接性和避免误导性代码完成声明方面有所改进。

    推荐理由:Vercel AI Gateway 新增了 OpenAI 的两个 GPT-6 变体,并说明了各自在价格、适用场景和可靠性上的定位差异。