跳到正文
10月2日周五
  1. LangChain 博客69

    LangChain 发布模型路由构建教程

    LangChain 在其开源编码代理 Open SWE 中实现模型路由,通过任务分析与模型分级匹配,将中位数成本降低64%且质量无明显下降。该教程详细说明了任务分类、模型选型、路由逻辑设计及效果验证方法,并提供可复用的中间件工具。

    推荐理由:原文给出了模型路由的构建步骤和实测效果,读者可直接复用其方法框架。

  2. NVIDIA Blog58

    NVIDIA 推出 64GB 内存版 DGX Spark 本地 AI 开发平台

    NVIDIA 发布 DGX Spark 64GB 内存配置,为开发者提供更低成本的本地 AI 开发与部署平台。该配置支持高达 1000 亿参数的模型完全在设备上运行,并可通过 NVIDIA Sync Cluster Assistant 将两台设备集群,将内存扩展至 128GB,在 Qwen 3.8 27B 测试中实现最高 1.7 倍的性能提升。

    推荐理由:NVIDIA 为 DGX Spark 推出更低内存配置,降低了本地 AI 开发的门槛,并展示了通过集群扩展性能的具体方法。

  3. SiliconANGLE31

    CoreWeave 称 GPU 的布线与供电方式可将 AI 延迟改变数个数量级

    CoreWeave 高级副总裁指出,GPU 的布线与供电配置能导致 AI 延迟产生数个数量级的差异。该公司推出的 CoreWeave Forge 开发层在一个互联环境中运行训练、推理、评估和智能体开发。同时,LlamaIndex 作为一家专注于文档解析与提取的模型构建商,其 75% 的工作负载是推理,并依赖专业云服务来应对突发性需求。

  4. SiliconANGLE31

    NetApp 与 Iterate.ai 合作推出 AIPod Mini,企业存储成为私有 AI 的记忆核心

    NetApp 与 Iterate.ai 合作推出 AIPod Mini 一体机,将企业存储数据转化为私有 AI 的记忆与知识核心。该设备内置 LLM,预装 200 多个智能体模板和 800 多种工具,支持在本地完全私有地运行 AI 查询。在保险业部署中,其将事故报告分析时间从 8 小时缩短至 8 分钟;在医疗领域,则为一家年账单 1.5 亿美元的医院识别出 1740 万美元的拒付索赔。

  5. O'Reilly Radar43

    Coding Agents Love Decision Records

    编码智能体倾向于依赖决策记录来维持项目上下文,但需避免将每个决策都转化为冗长的法庭记录。将架构决策记录(ADRs)存储为 Markdown 文件,明确区分已接受、提议和已被替代的决策,有助于智能体理解代码意图而非仅依赖实现细节。更新 ADR 时应仅保留当前文本,并通过 Git 历史记录变更日志,避免在 ADR 头部添加修订日志。

  6. SiliconANGLE25

    FlexPod 推出预测试 AI 堆栈以应对企业集成风险

    NetApp 与 Cisco 将其融合基础设施产品 FlexPod 重塑为应对 AI 复杂性的预测试解决方案,旨在为企业提供无需自行集成的可信平台。该联合产品线已服务超 10,000 家企业客户,并创造了 210 亿美元的生态系统价值。双方于今年 6 月扩展了 FlexPod 以支持 AI 部署,并将继续深化合作。

  7. InfoQ · AI/ML72

    OpenAI DevDay 2026 发布多项开发者产品更新

    OpenAI 在 DevDay 2026 上宣布了一系列产品和开发者更新。GPT-6.1 Sol 模型在多项评测中接近 GPT-6 Astra,但输入/输出 token 价格仅为后者的五分之一。

    推荐理由:原文详细列举了多项产品更新及其开发者接口,读者可以据此评估 OpenAI 平台向持续智能体工作流的转变。

  8. InfoQ · AI/ML31

    QCon San Francisco 2026:为智能体时代构建生产系统

    QCon San Francisco 2026 大会将探讨 AI 智能体作为生产系统用户带来的工程挑战与实践。来自 Airbnb、OpenAI、Netflix 和 Honeycomb 的工程师将分享在客户支持、广告系统构建、分布式存储优化及提升系统对智能体可理解性等方面的生产级经验。会议旨在连接新兴的 AI 实践与分布式系统、架构、可观测性等领域的既有经验。

  9. InfoQ · AI/ML52

    DigitalOcean 发布托管 AI 智能体服务 DigitalOcean Managed Agents

    DigitalOcean 推出托管云基础设施服务 DigitalOcean Managed Agents,旨在解决 AI 智能体在生产环境中的部署和扩展难题。该服务包含 Harness Runtime 和 Action Gateway 两个核心组件,前者提供基于 microVM 的隔离、持久化计算环境,后者通过统一 MCP 端点提供超过 16,000 种工具的安全访问。

  10. Vercel 博客41

    Vercel AI SDK for Python 新增 Jev 实验性 API

    Vercel 为 Python 开发者发布了 AI SDK 的最新版本,新增了实验性的 `evaluate()` API 以直接调用 Jev 模型。Jev 是一种基于大语言模型构建的通用分类器,旨在快速、低成本地处理结构化分类任务,并返回 JSON 格式的答案和置信度。开发者可通过 `uv add ai` 安装 SDK,并设置 AI Gateway 密钥来使用该功能。

  11. Databricks 博客39

    Genie One 如何重塑财务团队的工作方式

    Genie One 作为基于企业业务上下文的AI协作者,帮助财务团队快速分析预算差异、现金流趋势、财务关账异常和支出模式,支持使用自然语言提问并基于已批准的指标定义和组织逻辑生成可信结果。该工具可将原本需数日完成的分析缩短至数分钟,支持创建可复用的工作流与自动化报告,结果可自动推送至聊天和邮件。目前已在Coty、Unilever等企业落地,提升财务洞察效率与响应速度。

  12. AWS Machine Learning Blog38

    如何在 Amazon Bedrock AgentCore 上使用智能体 AI 扩展云迁移

    一种基于 Amazon Bedrock AgentCore 的四智能体模式,将单个应用的基础设施即代码开发时间从 3-4 周缩短至分钟级。该模式与 AWS Transform 和 AWS DMS 等托管服务协同工作,通过 Model Context Protocol 工具连接组织内部系统,并包含 Intake、IaC、迁移治理及 SRE 四个专用智能体。

  13. SiliconANGLE47

    IBM 允许其 Bob 智能体开发平台进行本地部署

    IBM 宣布其智能体软件开发平台 IBM Bob 提供自托管部署选项,允许企业在自有基础设施内使用 AI 构建和现代化应用。该选项支持本地、私有云、主权云和物理隔离环境,使客户能更好地控制数据驻留、安全策略和开发工作流。平台保留了 BobShell IDE、并行工具调用等核心功能,并支持本地运行 Nvidia Nemotron 等模型或通过混合配置连接外部模型服务。

  14. SiliconANGLE34

    AI 智能体基础设施如何构建持续学习循环

    Cognition AI 的 Devin 智能体已能参与从编码到响应生产问题的完整软件生命周期,这要求基础设施支持大规模持续学习。其训练与推理日益交织,需在数千个 GPU 上实现 99.99% 的可靠性以保障不间断训练。CoreWeave 推出的 Forge 平台旨在连接推理、数据整理、模型改进与评估,为构建此类学习循环提供支持。

  15. SiliconANGLE35

    NetApp 与 Nvidia 重新思考 AI 工厂的存储架构

    NetApp 与 Nvidia 合作重新设计面向 AI 工厂的存储架构,推出了分离数据与元数据功能的 Novus 架构,以支持两者独立扩展。该设计旨在避免元数据的小型事务操作与大型数据传输争抢资源,从而提升 GPU 利用率并降低能耗。新架构还强调通过 API 和 SDK 提供代理友好的控制平面,使 AI 团队无需成为存储专家即可消费存储资源。

  16. AWS Machine Learning Blog46

    使用 NVIDIA NeMo Agent Toolkit 和 Amazon S3 Vectors 构建智能体记忆

    NVIDIA NeMo Agent Toolkit (NAT) 可通过自定义插件将 Amazon S3 Vectors 集成为持久化记忆后端。该实现利用 Amazon Titan Text Embeddings V2 生成嵌入向量,并支持基于元数据的过滤和强一致性写入。此方案为需要弹性扩展至数十亿向量、具备成本效益的多智能体生产系统提供了记忆层。

  17. AWS Machine Learning Blog30

    AWS 博客:使用上下文多臂老虎机在 AWS 上通过个性化提升获客漏斗的转化率

    Amazon Payments 在 Amazon SageMaker AI 上应用了基于多目标上下文多臂老虎机的个性化方案,以优化产品获客漏斗。一项为期七周的在线 A/B 测试显示,针对某一客户群体,漏斗最终转化率实现了较高的个位数百分比相对提升。该方案使用 LinUCB 算法,通过线性组合各阶段(申请开始、提交、批准)的 UCB 分数来同时优化整个漏斗,并提供了可在合成数据上测试的代码库。

  18. AWS Machine Learning Blog45

    使用 Amazon Bedrock AgentCore 构建环境智能体:从事件驱动信号到人机协同工作流

    Amazon Bedrock AgentCore 平台支持构建响应事件流的环境智能体,通过内置的 `ask_human` 工具在需要时暂停以获取人工输入。该平台利用 AWS Lambda 进行事件处理,并集成 Anthropic Claude Sonnet 4.5 等基础模型,提供基于容器的执行环境以支持长时间运行的工作负载。

  19. AWS · AI 博客30

    实现 Claude 平台在 AWS 上的多环境访问

    本文介绍如何在 AWS 上为 Claude 平台配置多环境访问,包括生产环境、开发环境和外部服务环境。通过创建专用的 AI Services 账户并设置跨账户 SigV4 认证、工作区限定的 API 密钥和 OIDC 联邦认证,实现不同环境之间的隔离与安全调用。每个步骤包含 CLI 命令、控制台操作或代码片段,适用于需要在 AWS 多账户架构中部署 Claude 平台的组织。

  20. AWS · AI 博客23

    Amazon Quick Sight 推出层级过滤器简化仪表板下钻操作

    Amazon Quick Sight 推出层级过滤器,允许作者在单一控件中提供多级过滤选项,减少界面杂乱并引导读者更快定位数据。该过滤器支持最多五级层级(如 Region → Sub-Region → Country → City → Town),可跨图表应用,无需单独设置多个过滤器。用户可通过拖拽调整层级顺序,且默认仅应用于当前图表,可切换为跨图表应用。

  21. SiliconANGLE31

    Flow Engineering 融资 5000 万美元,将 AI 能力引入硬件工程

    AI 智能体驱动的硬件系统设计平台 Flow Engineering 完成 5000 万美元 B 轮融资,公司估值达 7.5 亿美元。其 AI 智能体可将硬件验证与确认的开发周期从数月缩短至数天,已被 Rivian、大众合资公司 RV Tech 等客户用作默认开发平台。新资金将用于构建领先的硬件工程 AI 平台,并扩大工程团队以满足受监管行业的需求。

  22. Solidot36

    PS5 模拟器的开发取得突破

    PS5 模拟器 SharpEmu 从 5 月的 Alpha 阶段发展到可加载真实游戏 eboot.bin 文件并执行原生 CPU 指令,部分支持 GPU 功能。已有 10 款游戏被标记为可玩,包括 Tetris Forever、Astro Bot 和 Demon’s Souls 重制版。另一款 KytyPS5 模拟器上周发布首个公开版本,支持 134 款游戏但多数存在严重 bug。

  23. SiliconANGLE31

    Nvidia 将 AI 工厂经济学与 token 和能效挂钩

    Nvidia 将 AI 工厂的经济产出核心指标定义为 token,并强调每瓦特 token 数成为衡量效率的关键。公司高管指出,Blackwell 架构实现了每瓦特 token 数 30 倍的提升,而 Groq 3 LPX 推理加速器与 Vera Rubin 平台结合,可为金融科技等实时场景提供更快的推理速度。这一转变要求数据中心作为统一计算系统运行,将设计重点从单个芯片转向整体基础设施。

10月1日周四
  1. Cloudflare · AI69

    Cloudflare 发布开源决策模型 Clef 及 RL 微调平台

    Cloudflare 发布其训练的开源决策模型 Clef 和 Clef-flash,并推出新的强化学习微调平台。Clef 模型在 Jev Decision Index 基准测试中领先,支持 64k 上下文窗口和视觉编码,并托管于 Workers AI 以降低延迟。模型已在 Hugging Face 以 Apache 2.0 许可证开源。

    推荐理由:原文提供了决策模型的具体能力、基准测试结果和微调平台细节,读者可以据此评估它如何提升智能体工作流的效率和确定性。

  2. Towards Data Science45

    一个公寓搜索智能体能否减少模型调用次数仍找到良好匹配?

    本文测试了三种方法减少调用大语言模型的次数,最终版本在相同 2,500 次检查中成本降低约 25 倍,从 $0.20 降至 $0.008,且未出现错误匹配。使用更简短的提示词和复用答案贡献了剩余成本下降,而 Sol 模型在仅接收标题和正文时的匹配准确率与完整列表相同。测试基于 500 条美国 2019 年公寓出租广告,每条广告需满足允许养狗等五项租客要求,数据来自 UCI 机器学习仓库。

  3. Cloudflare · AI59

    Cloudflare Workers AI 接入 EuroLLM 和 Apertus 两个欧洲开源模型

    Cloudflare 宣布其 Workers AI 平台接入两个欧洲开源大模型 EuroLLM 和 Apertus,并开放访问申请。EuroLLM 支持 35 种语言,包括所有 24 种欧盟官方语言;Apertus 在超过 1500 种语言的 15 万亿 token 上训练,其架构、权重、训练数据和方法均已公开。

    推荐理由:原文介绍了两个欧洲开源模型接入其平台,并提供了具体的技术细节和申请入口,读者可以据此评估其多语言能力和合规设计。