跳到正文
10月3日周六
  1. PyTorch 博客42

    使用 Helion 为 vLLM 构建高性能可移植的线性后端

    研究团队将 Helion 集成到 vLLM 的线性后端,以探索其自动调优的高层内核 DSL 如何提升大语言模型推理性能并降低内核实现复杂度。在 NVIDIA Hopper GPU 上,该后端通过逐形状调优与混合调度,在评估的模型中性能超越了 vLLM 默认的 CUTLASS 和 DeepGEMM 后端,部分工作负载的吞吐量提升超过 10%。

10月2日周五
  1. Writer 博客28

    BetterHelp 首席增长官如何构建 AI 原生营销引擎

    BetterHelp 首席增长官 Sara Brooks 通过创建 AI Excellence 职能和采用 WRITER 平台,在公司内部构建了 AI 原生营销引擎。团队利用 WRITER 存储品牌资产并生成内容,开发了从策略到创意的端到端智能体化活动流程,并通过 A/B 测试验证了其效果。Sara 本人每日亲自使用 WRITER 工作流,以领导者的亲身实践推动团队采用 AI。

  2. LangChain 博客69

    LangChain 发布模型路由构建教程

    LangChain 在其开源编码代理 Open SWE 中实现模型路由,通过任务分析与模型分级匹配,将中位数成本降低64%且质量无明显下降。该教程详细说明了任务分类、模型选型、路由逻辑设计及效果验证方法,并提供可复用的中间件工具。

    推荐理由:原文给出了模型路由的构建步骤和实测效果,读者可直接复用其方法框架。

  3. NVIDIA Blog58

    NVIDIA 推出 64GB 内存版 DGX Spark 本地 AI 开发平台

    NVIDIA 发布 DGX Spark 64GB 内存配置,为开发者提供更低成本的本地 AI 开发与部署平台。该配置支持高达 1000 亿参数的模型完全在设备上运行,并可通过 NVIDIA Sync Cluster Assistant 将两台设备集群,将内存扩展至 128GB,在 Qwen 3.8 27B 测试中实现最高 1.7 倍的性能提升。

    推荐理由:NVIDIA 为 DGX Spark 推出更低内存配置,降低了本地 AI 开发的门槛,并展示了通过集群扩展性能的具体方法。

  4. Vercel 博客41

    Vercel AI SDK for Python 新增 Jev 实验性 API

    Vercel 为 Python 开发者发布了 AI SDK 的最新版本,新增了实验性的 `evaluate()` API 以直接调用 Jev 模型。Jev 是一种基于大语言模型构建的通用分类器,旨在快速、低成本地处理结构化分类任务,并返回 JSON 格式的答案和置信度。开发者可通过 `uv add ai` 安装 SDK,并设置 AI Gateway 密钥来使用该功能。

  5. Databricks 博客39

    Genie One 如何重塑财务团队的工作方式

    Genie One 作为基于企业业务上下文的AI协作者,帮助财务团队快速分析预算差异、现金流趋势、财务关账异常和支出模式,支持使用自然语言提问并基于已批准的指标定义和组织逻辑生成可信结果。该工具可将原本需数日完成的分析缩短至数分钟,支持创建可复用的工作流与自动化报告,结果可自动推送至聊天和邮件。目前已在Coty、Unilever等企业落地,提升财务洞察效率与响应速度。

  6. AWS Machine Learning Blog38

    如何在 Amazon Bedrock AgentCore 上使用智能体 AI 扩展云迁移

    一种基于 Amazon Bedrock AgentCore 的四智能体模式,将单个应用的基础设施即代码开发时间从 3-4 周缩短至分钟级。该模式与 AWS Transform 和 AWS DMS 等托管服务协同工作,通过 Model Context Protocol 工具连接组织内部系统,并包含 Intake、IaC、迁移治理及 SRE 四个专用智能体。

  7. AWS Machine Learning Blog46

    使用 NVIDIA NeMo Agent Toolkit 和 Amazon S3 Vectors 构建智能体记忆

    NVIDIA NeMo Agent Toolkit (NAT) 可通过自定义插件将 Amazon S3 Vectors 集成为持久化记忆后端。该实现利用 Amazon Titan Text Embeddings V2 生成嵌入向量,并支持基于元数据的过滤和强一致性写入。此方案为需要弹性扩展至数十亿向量、具备成本效益的多智能体生产系统提供了记忆层。

  8. AWS Machine Learning Blog30

    AWS 博客:使用上下文多臂老虎机在 AWS 上通过个性化提升获客漏斗的转化率

    Amazon Payments 在 Amazon SageMaker AI 上应用了基于多目标上下文多臂老虎机的个性化方案,以优化产品获客漏斗。一项为期七周的在线 A/B 测试显示,针对某一客户群体,漏斗最终转化率实现了较高的个位数百分比相对提升。该方案使用 LinUCB 算法,通过线性组合各阶段(申请开始、提交、批准)的 UCB 分数来同时优化整个漏斗,并提供了可在合成数据上测试的代码库。

  9. AWS Machine Learning Blog45

    使用 Amazon Bedrock AgentCore 构建环境智能体:从事件驱动信号到人机协同工作流

    Amazon Bedrock AgentCore 平台支持构建响应事件流的环境智能体,通过内置的 `ask_human` 工具在需要时暂停以获取人工输入。该平台利用 AWS Lambda 进行事件处理,并集成 Anthropic Claude Sonnet 4.5 等基础模型,提供基于容器的执行环境以支持长时间运行的工作负载。

  10. AWS · AI 博客30

    实现 Claude 平台在 AWS 上的多环境访问

    本文介绍如何在 AWS 上为 Claude 平台配置多环境访问,包括生产环境、开发环境和外部服务环境。通过创建专用的 AI Services 账户并设置跨账户 SigV4 认证、工作区限定的 API 密钥和 OIDC 联邦认证,实现不同环境之间的隔离与安全调用。每个步骤包含 CLI 命令、控制台操作或代码片段,适用于需要在 AWS 多账户架构中部署 Claude 平台的组织。

  11. AWS · AI 博客23

    Amazon Quick Sight 推出层级过滤器简化仪表板下钻操作

    Amazon Quick Sight 推出层级过滤器,允许作者在单一控件中提供多级过滤选项,减少界面杂乱并引导读者更快定位数据。该过滤器支持最多五级层级(如 Region → Sub-Region → Country → City → Town),可跨图表应用,无需单独设置多个过滤器。用户可通过拖拽调整层级顺序,且默认仅应用于当前图表,可切换为跨图表应用。

10月1日周四
  1. Cloudflare · AI69

    Cloudflare 发布开源决策模型 Clef 及 RL 微调平台

    Cloudflare 发布其训练的开源决策模型 Clef 和 Clef-flash,并推出新的强化学习微调平台。Clef 模型在 Jev Decision Index 基准测试中领先,支持 64k 上下文窗口和视觉编码,并托管于 Workers AI 以降低延迟。模型已在 Hugging Face 以 Apache 2.0 许可证开源。

    推荐理由:原文提供了决策模型的具体能力、基准测试结果和微调平台细节,读者可以据此评估它如何提升智能体工作流的效率和确定性。

  2. Arize 博客38

    Alyx 现在能跨会话记住你的工作内容,支持长期记忆功能

    Alyx 现在支持长期记忆功能,可在跨会话中保留项目目标、偏好和先前决策等有用上下文。该功能默认对所有 Arize AX 用户开放,记忆内容不共享给团队成员或跨空间,用户可通过聊天要求 Alyx 展示、修正或删除记忆。长期记忆帮助用户减少重复解释环境的步骤,提升在追踪、评估和实验中的工作效率。

  3. Cloudflare · AI59

    Cloudflare Workers AI 接入 EuroLLM 和 Apertus 两个欧洲开源模型

    Cloudflare 宣布其 Workers AI 平台接入两个欧洲开源大模型 EuroLLM 和 Apertus,并开放访问申请。EuroLLM 支持 35 种语言,包括所有 24 种欧盟官方语言;Apertus 在超过 1500 种语言的 15 万亿 token 上训练,其架构、权重、训练数据和方法均已公开。

    推荐理由:原文介绍了两个欧洲开源模型接入其平台,并提供了具体的技术细节和申请入口,读者可以据此评估其多语言能力和合规设计。

  4. Cloudflare · AI60

    Cloudflare OS 开放全托管部署候补名单并更新功能

    Cloudflare OS 宣布开放全托管部署的候补名单,用户可通过仪表板快速启动组织专属的智能体工作空间。本次更新新增了连接 GitHub 仓库进行代码操作、改进 Google Workspace 集成以处理邮件和文档,以及支持将工作成果导出为 Excel、PDF 等多种格式的功能。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  5. Vercel 博客35

    Microsoft AI 模型现已在 AI Gateway 上可用

    Vercel 与 Microsoft AI 合作,将 MAI 模型引入其 AI Gateway 平台。平台新增支持 MAI-Voice-2.1、MAI-Voice-2.1-Flash 和 MAI-Transcribe-2 Streaming 三款音频模型,分别用于生成多语言语音、低延迟语音交互和实时音频转录。AI Gateway 按模型官方费率计费,不收取平台费用或推理加价。

  6. Anthropic 新闻26

    Barclays 扩展 Claude 集成以升级运营并改善客户体验

    Barclays 将 Claude 集成至全球运营,以加速软件开发、现代化遗留系统并提升效率。目前 Claude Code 的采用率预计到 2026 年底将覆盖 50% 的开发人员,2027 年将扩展至多数软件工程师。该银行通过 Claude 提供知识辅助,已帮助 16,000 名员工处理超 100 万次查询,并每日处理约 12 万封客户邮件。

  7. Databricks 博客50

    Databricks 推出 ai_decide AI 功能,实现对受管数据的快速决策

    Databricks 发布 ai_decide AI 功能,基于决策模型在毫秒级完成对受管数据的结构化判断,支持分类、评分与实时决策。该功能可在 SQL 中调用,也可通过 REST API 用于实时应用与智能体,延迟与成本显著低于传统 LLM。目前处于 Beta 阶段,兼容 TypeSafe AI 的 Jev 模型,支持在 Databricks 上直接运行开源决策模型。

  8. PyTorch 博客38

    PyTorch Conference North America 2026:聚焦 Ray 的分布式 AI 指南

    PyTorch Conference North America 2026 即将在圣何塞举行,为开源 AI 社区提供交流平台。会议指南重点介绍了多场关于分布式计算框架 Ray 的议题,涵盖其与 Kubernetes 的协同演进、在 LinkedIn 和 Uber 等公司的生产级数据与模型训练应用,以及在模型推理与后训练阶段的关键作用。