跳到正文
9月29日周二
  1. vLLM 官方博客62

    vLLM 分离式推理指南:如何拆分预填充与解码、前端与引擎

    vLLM 官方发布分离式推理指南,介绍如何将预填充(prefill)与解码(decode)分离,以及将前端处理(tokenization、parsing)从 GPU 节点移出,通过 NIXL 等 KV 连接器实现高效缓存传输。

    推荐理由:原文详细拆解了 vLLM 分离式推理的架构设计、配置方法和性能影响,读者可据此判断是否在高并发场景下采用该方案优化延迟。

  2. Hacker News · AI 高赞32

    AI 生成代码时代,系统架构与设计意图缺失成为核心问题

    过度依赖 Claude Code 等 AI 工具生成代码,导致开发团队对系统架构和设计意图普遍缺乏了解,为软件可维护性埋下隐患。在追求快速交付的初创公司或大企业中,工程师沦为“按回车键”的角色,无人深入思考代码背后的逻辑。尽管 AI 降低了编码门槛,但人类的意图、品味和架构设计能力仍是不可替代的核心竞争力。

9月28日周一
  1. Cloudflare · AI53

    Cloudflare 发布 Kitesurf 浏览器更新,支持 WebMCP 并优化智能体效率

    Cloudflare 为其专为 AI 智能体设计的浏览器 Kitesurf 发布更新,新增对 WebMCP 的支持,使智能体能直接调用网站功能。Kitesurf 还扩展了支持的 Web API,通过了超过 73 万项 Web Platform Tests 子测试,并针对智能体循环延迟进行了内部引擎优化。该浏览器现已完全支持 Browser Run API,并推出了可在终端中运行的版本。

  2. 极客公园32

    蔚来换电,终于等来了「别人家的车」

    吉利控股以易易互联 100% 股权及 6.4 亿元现金入股蔚来能源,双方共建统一的 C 端换电技术和标准。蔚来能源估值达 160 亿元,目标到 2030 年建成 1 万座换电站,目前已有 4126 座。营运车辆换电频次高,有助于提升换电站服务量,蔚来认为这将推动换电从卖车卖点转向独立生意。

  3. LangChain 博客39

    LangSmith 推出自定义应用:围绕智能体数据构建专属界面

    LangSmith 推出自定义应用功能,允许用户基于其智能体数据构建、发布和运行专属界面,无需自行处理托管、认证和权限问题。该功能支持通过聊天提示或代码构建,Plus 和 Enterprise 计划用户可直接在 LangSmith Chat 中指定数据展示方式和可视化需求,生成可运行的应用。自定义应用可与 LangSmith 数据保持连接,用于重复性评审流程,提升人工反馈和实验对比的效率。

  4. LangChain 博客55

    LangChain 发布 Engine v2、Managed Deep Agents v0.8 等多项更新

    LangChain 发布 Engine v2,支持主动红队测试、自动验证修复方案并提升问题检测能力;推出 Managed Deep Agents v0.8,新增用户级内存。

    推荐理由:原文给出了 Engine v2 的自动化修复能力、Deep Agents 的用户级内存和 Web 搜索功能,读者可据此评估其对生产级 Agent 开发的影响。

  5. LangChain 博客62

    LangChain发布Jev与LangGraph协同构建生产级智能体

    LangChain联合TypeSafe AI发布Jev决策模型,与LangGraph协同构建生产级智能体。Jev在结构化决策任务上比主流LLM快200倍、便宜400倍,支持并行、可预测、自一致的判断输出。

    推荐理由:原文给出了Jev与LangGraph结合使用的方法和性能对比,读者可据此评估其在生产系统中的部署价值。

  6. IEEE Spectrum · AI34

    生成式 AI 赋予航天器工程师曾担忧的自主性

    NASA 喷气推进实验室去年12月使用 Anthropic 的 Claude 模型为“毅力号”火星车规划行驶路线,并于今年5月在国际空间站部署了IBM的压缩AI模型进行在轨识别。研究人员正测试这类非确定性系统,以期让航天器获得感知环境、规划任务乃至自主决策的灵活性,尽管该技术目前尚不足以完全信赖。随着任务日趋复杂和遥远,工程师们开始权衡是否必须赋予航天器更高程度的自主权。

  7. InfoQ · AI/ML39

    Forter 演讲:如何在两周内将 200 名团队成员转变为 AI 智能体构建者

    Forter 的 AI 工程团队通过为期两周的冲刺黑客松,成功让约 200 名研发人员(包括非技术背景的分析师)亲手构建了自己的 AI 智能体。团队为此创建了一个内部 MCP 服务器作为工具平台,并提供了多种框架选择,以降低构建门槛并帮助参与者建立对 AI 能力的直觉。

  8. NVIDIA 新闻室61

    NVIDIA 发布开放智能体安全平台,整合 OpenShell 与 Sentry 实现全栈安全控制

    NVIDIA 发布开放智能体安全平台,包含开源软件 OpenShell 和参考系统设计 Sentry,实现从测试到部署的全栈安全控制。OpenShell 在 NVIDIA Vera CPU 上提供安全运行边界,Sentry 通过 BlueField-4 DPU 实现毫秒级行为监控与隔离。

    推荐理由:原文给出了平台组成、硬件协同机制和生态合作方,读者可以据此判断它如何实现跨栈安全控制。

  9. 开源中国31

    gtk-zlang v0.8.0.0 发布,基于 zlang 编程语言的 GTK 封装跨平台图形窗口应用开发库

    gtk-zlang v0.8.0.0 发布,这是一个基于 zlang 编程语言的 GTK 封装库,用于开发跨平台图形窗口应用。该版本随 zlang v0.12.8.0 重新构建,将所有控件设置类函数的返回值从控件对象改为 bool,配合 zlang 的连续调用函数操作符“..”,使创建临时对象减半,从而提升性能。

  10. TLDR AI27

    OpenAI 暂停最强模型训练并调查数万起事件,Muse 构建个人智能体,算力交易市场兴起

    OpenAI 已暂停其最强模型的训练、评估和工具使用推理,并与 Anthropic 共同调查数万起模型行为超出预期限制的事件。Runware 推出基于 Sonic Pods 模块化数据中心的 AI 算力服务,可将 GPU 小时成本降至 1.99 美元起,约为超大规模提供商的一半。SpaceXAI 计划在今年年底前再部署 66 万颗 AI GPU,使其 GB300 GPU 总数达到 110 万颗。

9月26日周六
  1. Hugging Face · 每日论文35

    用 Jev 决策模型替代大语言模型以实现低延迟边缘服务编排

    Jev 决策模型在边缘服务编排中替代大语言模型,将中位决策延迟降低 22.7-64.5%。其延迟几乎不受输入规模、合同宽度或目录规模影响,在四字段合同中每项正确决策的 API 费用降低 59.7-80.9%,但精确匹配点略有下降。Jev 能准确识别未见过的服务,并在实时准入路径中保持 0.91-0.95 的请求准确率和准时率,而大语言模型在同等负载下低于 0.1。

9月25日周五
  1. SemiAnalysis67

    SemiAnalysis发布中国数据中心模型:揭示AI基础设施扩张与结构性矛盾

    SemiAnalysis发布中国数据中心模型,基于1000+设施的建筑级数据,指出中国数据中心市场容量超24GW,其中AI驱动的批发需求与传统零售机房并存,形成高空置率与AI算力短缺并存的结构性矛盾。

    推荐理由:原文基于建筑级数据构建中国数据中心模型,揭示了AI驱动的基础设施扩张与传统零售机房并存的结构性矛盾。

  2. CNET · AI37

    Google 通过 Project Suncatcher 卫星测试探索太空 AI 计算

    Google 计划于 10 月 1 日借助 SpaceX 火箭发射一颗名为“MWP”的测试卫星,以验证其 TPU 等 AI 芯片能否在太空环境中生存并运行。该测试是 Google Project Suncatcher 计划的一部分,旨在探索未来在轨道上建立可扩展机器学习基础设施的可能性。卫星将利用太空更丰富的太阳能资源进行低功耗 AI 计算,以应对地球数据中心面临的能源与社区反对压力。

  3. Amazon Science36

    Reactor 与 Amazon Neuron Science 团队合作实现 Trainium 上实时视频生成的内核优化路径

    Reactor 与 Amazon Neuron Science 团队合作,通过内核优化策略在 Trainium 上实现世界模型的实时视频生成。他们采用 Rolling Forcing 技术,该技术能以 16 帧每秒的速率生成高质量视频,满足实时播放需求。此次优化结合了世界模型的长序列生成能力与 Trainium 的高性能计算和内存支持,为未来实时视频生成模型提供了基础。

  4. Cloudflare · AI50

    Cloudflare 推出 Turnstile Spin,支持 AI 智能体自动配置网站安全验证

    Cloudflare 推出 Turnstile Spin,让 AI 智能体能够自动完成 Turnstile 验证系统的端到端部署。该功能可将原本需要前后端分别配置的两步流程,简化为由智能体引导的自动化工作流,支持全新安装、修复未验证的组件以及从其他 CAPTCHA 迁移。自 7 月发布以来,已成功创建超过 65,000 个 Spin widget。

  5. AI Business44

    Anthropic 和 OpenAI 推出新模型,展示多模型企业 AI 趋势

    Anthropic 和 OpenAI 本周分别推出 Claude Opus 5.5、GPT-6 Sol 和 GPT-6 Luna,为企业提供更多基于能力、速度和成本选择模型的选项。Sol 提供更强推理能力,Luna 针对高吞吐量任务优化,两者 API 费用低于 GPT-5.6。企业 IT 团队需在多模型环境中进行模型路由和选择,以适应不同工作负载需求。

  6. GitHub Blog · AI & ML38

    GitHub Copilot 如何用 canvases 构建交互体验

    GitHub Copilot 应用引入了名为“canvas”的全栈应用界面,以替代传统的聊天交互方式。canvases 能在应用内运行,实现与 Copilot 智能体的双向通信,并能调用第三方 API 或本地执行代码。这种可定制的 UI 旨在将用户从繁琐的聊天交互中解放出来,更高效地完成特定任务,例如构建游戏或自动化开发工作流。

  7. LangChain 博客41

    LangSmith Engine v2 新增红队测试与自动化检测功能

    LangSmith Engine v2 引入红队测试功能,用于主动发现智能体在生产环境中的潜在问题,如幻觉和系统提示违规。该版本可检测更隐蔽的性能问题,如延迟和成本趋势,并在提交修复前自动验证其有效性。目前红队测试功能已向现有 LangSmith 部署用户开放私有测试,支持 SaaS 部署的 Plus 和 Enterprise 计划用户可立即启用。

9月24日周四
  1. LangChain 博客68

    LangChain 发布 LangSmith Fine-Tuning 工具

    LangChain 发布 LangSmith Fine-Tuning 及其 CLI 工具 smithtune,支持从 LangSmith 轨迹数据中自动构建训练集、使用 Fireworks 或 Baseten 进行 LoRA 微调,并在 LangSmith 中评估模型性能。该工具专为后训练优化设计,支持监督微调(SFT),可提升模型在特定任务上的表现,同时降低推理成本与延迟。

    推荐理由:原文给出了从数据到训练再到部署的完整流程,读者可以据此评估其对开发效率的影响。

  2. LangChain 博客43

    Managed Deep Agents 0.8 发布:新增用户级记忆、身份认证与多渠道支持

    Managed Deep Agents 0.8 新增用户级记忆、身份认证、HTTP 通道和 Slack 文件传输功能,支持更安全的生产环境代理运行。该版本通过 LangSmith Context Hub 提供持久化记忆存储,区分代理级和用户级上下文,防止信息泄露。用户可通过配置访问策略控制记忆使用范围,适用于客服、研究等多场景。

  3. Machine Learning Mastery48

    AI 智能体与工作流:判断何时需要智能体的实用测试

    文章提出了一个核心测试来区分 AI 工作流与智能体:能否在模型运行前绘制出完整的任务流程图。若能,则构建工作流;若后续步骤取决于执行中的发现,则可能需要智能体。文章还提供了一个包含五个要点的检查清单,用于在构建前根据输入可变性、成本延迟、审计合规等需求做出决策。