NVIDIA FLARE 如何跨 Docker、Kubernetes 和 Slurm 扩展联邦学习
NVIDIA FLARE 提供了跨 Docker、Kubernetes 和 Slurm 等异构基础设施扩展联邦学习工作流的能力。该框架使多个研究项目能在共享的 GPU 资源上保持隔离运行,同时确保每个参与组织对其数据和计算资源保持控制权。
NVIDIA FLARE 提供了跨 Docker、Kubernetes 和 Slurm 等异构基础设施扩展联邦学习工作流的能力。该框架使多个研究项目能在共享的 GPU 资源上保持隔离运行,同时确保每个参与组织对其数据和计算资源保持控制权。
LangChain 博客分享了施耐德电气、沃达丰和monday.com在欧洲与中东地区规模化智能体的实践经验。
LangChain 发布用于管理付费广告的智能体,支持跨平台数据整合、自动分析与提案,已开源并可通过 Managed Deep Agents 部署至 Slack。该智能体在六个月内使付费媒体贡献营销管道比例从 0 提升至 20%,成本下降 30%,并实现了 40 倍的报告生成效率提升。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
NVIDIA Research 发布 FoundationStereo,一款用于立体图像深度估计的混合 Transformer-CNN 架构模型,可输出高精度的视差图。
NVIDIA Transformer Engine 通过优化 JAX 中的专家路由,实现了无丢弃的 MoE 训练加速。该技术消除了传统 MoE 训练中因容量因子限制而丢弃 token 的现象,提升了训练效率。
LangChain 发布 GTM 智能体,可自动处理新线索的调研与邮件草稿生成,并聚合账户级信号以支持销售与工程团队。该功能基于 Deep Agents 构建,支持多工具协同、人类审核、学习反馈循环,并已集成至 Slack 与 LangSmith。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
LangChain 在 Managed Deep Agents 中推出 Connections 功能,支持管理凭据和按调用者身份识别。连接分为代理所有(agent-owned)和用户所有(user-owned)两种,前者共享凭据用于通用工具如 Tavily 搜索,后者通过 OAuth 实现用户级身份,支持 GitHub、Linear 等服务。
推荐理由:原文给出了连接管理的三种模式和代码调用方式,读者可以据此判断如何在智能体中实现安全的凭据分离与用户身份识别。
Credit Genie 采用 LangChain 的 OpenWiki 工具,自动化生成和维护代码库文档,解决了文档过时和部落知识问题。该系统每日通过 GitHub Pages 提供统一的可搜索界面,并在代码库中 openwiki/ 文件夹自动生成文档更新。团队通过此工具提升了跨系统协作效率,减少了手动维护需求,目前正计划整合内部跨仓库知识图谱以增强其智能性。
GitHub 日本与韩国营销负责人利用 GitHub Copilot 和 GitHub Actions,将营销活动从策划到跟进的全流程自动化。该系统以 GitHub Issue 为起点,通过 Issue 表单、标签和 Actions 工作流,自动处理活动落地页创建、链接生成、邮件发送、CRM 数据同步等重复任务。
NVIDIA NIM 通过全栈优化,使 Nemotron 3 Ultra 模型在保持交互性的前提下,支持的并发用户数提升了 2.5 倍。该优化对于提示词较长、需跨步骤复用上下文的智能体 AI 工作负载尤为重要。
NVIDIA BioNeMo Inference Runtime (BioIR) 加速了生物分子结构预测模型在 NVIDIA GPU 上的运行。它通过优化的内核和 CUDA Graphs 等技术提升模型推理速度,同时保持了熟悉的 PyTorch 工作流程,适用于蛋白质组规模的高通量预测任务。
Replit 与 Databricks 的集成现已正式发布,支持原生 Lakebase 数据库。该集成允许企业团队在 Replit 上构建应用,并通过 Databricks 管理和提供受控的实时企业数据访问。应用部署时,Replit Agent 自动创建 Lakebase 数据库,无需手动设置,同时支持预览部署和基于角色的访问控制。
Mistral 与 Cloudera 建立合作伙伴关系,将 Mistral 的模型集成至 Cloudera 的混合数据平台。企业可在私有云、公有云、本地及完全隔离的环境中部署和运行推理,并利用自有专有数据训练定制化模型,保持对数据和生成智能的完全所有权与控制。此次合作旨在满足市场对主权 AI 日益增长的需求,确保数据、智能、计算和运营全程由客户掌控。
NVIDIA 利用其 Nemotron 大语言模型与 Palantir Foundry 平台,将复杂的全球供应链专业知识转化为可执行的代码。该系统旨在优化从晶圆产出到 AI 模型生成首个 token 的全流程效率,覆盖从芯片出厂到数据中心上架,再到软件栈部署的各个环节。
Together AI 推出抢占式计算功能,允许用户以标准按需算力价格的一半运行可中断任务,如实验、批量推理和微调。抢占式节点基于 NVIDIA 加速算力,使用未占用资源,可在五分钟后被回收,且无需额外申请替代资源。该功能当前仅支持 Kubernetes 集群,用户可通过控制台、CLI 或 API 设置抢占式算力目标并调度任务。
Together AI 在 NVIDIA Vera Rubin NVL72 平台上部署了 ThunderKittens 2.0 GEMM 内核,实现 NVFP4 和 FP8 矩阵乘法运算,但性能仅达到理论峰值的 42.1% 和 44.4%。
NVIDIA 介绍了使用 Encode-Prefill-Decode (EPD) 解耦技术来优化多模态模型推理。该技术将视觉编码器阶段与预填充和解码阶段分离,尤其适用于图像密集型提示词、中短输出及量化 MoE 模型。结合 NVIDIA Dynamo 使用,可实现高达 5 倍的推理加速。
WRITER 推出 Enterprise Brain,这是一个受管控的通用上下文层,能动态捕获企业的品牌、制度知识、决策逻辑和实时业务数据,供所有团队和智能体实时使用。
Mistral AI 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 代码迁移至 C++,并重构了物理密集型的油藏模拟器架构。项目首先构建了数值对等性验证框架,确保新旧代码输出一致,并利用上百个 AI 智能体自动解析代码调用树、整合分散文档。通过采用“规划-编码-测试-评审”的多智能体工作流与人机协同检查点,最终在保障代码质量的同时完成了现代化重构。
Together AI 发布了一篇关于开源AI栈的深度指南,将栈分解为模型、推理、网关、工具等独立层,并解释了如何组合这些组件来构建自定义的AI开发工作流。
Weaviate 推出 HFresh,一种基于磁盘的向量索引,旨在通过降低内存使用支持更大规模的数据集。HFresh 借鉴 SPFresh 研究论文理念,采用分区策略并使用 HNSW 作为中心索引,实现高效的查询路由和可控的磁盘 I/O。该索引支持增量再平衡操作,避免了传统索引需要全量重建的问题,适用于对内存敏感且需处理大规模数据的应用场景。
决策轨迹记录了AI智能体在做出决策时的推理步骤、工具调用和上下文信息,使决策过程可追溯和可查询。这些信息存储在上下文图中,与对话、事实和其他相关数据保持连接,便于后续审查和分析。决策轨迹支持可解释性、调试、合规审查、一致性提升和跨智能体的知识共享。
NVIDIA 宣布将大力投入 Rust 原生 GPU 编程,并计划在 2027 年及以后持续发展和完善 CUDA Rust 工具链。此举旨在为不断变化的 AI 模型和技术提供从推理引擎到智能体运行时的系统层支持。
Building Foundry 第三部分介绍了如何将现有档案库转化为可搜索的创意资源库,通过只读扫描、准备元数据并同步至 Weaviate 实现。该流程生成包含文件名、路径、类型、标签、描述和源 URI 的记录,无需移动或重命名文件。用户可通过关键词、语义或混合搜索模式查找内容,并通过项目、文件类型等过滤器缩小范围。
Neo4j 发布 Aura Agent 功能,实现 Salesforce Agentforce 与 Neo4j 知识图谱的无代码多智能体集成。该功能通过 MCP 协议连接,将图谱计算与工作流分离,使 Agentforce 仅需发送自然语言问题,Aura Agent 负责解析、执行 Cypher 查询并返回带证据的推荐结果,无需自定义代码。
Neo4j 发布 Neocarta 语义层,通过在 Neo4j 中构建跨 BigQuery 和 Databricks 的元数据图,使 Text2SQL 代理在 278 张 Census 表和 264 张 Databricks 表的复杂环境中。
推荐理由:原文展示了在大规模、复杂数据环境中,通过图结构语义层显著提升Text2SQL的准确性和成本效益,可直接复用于企业级数据接入场景。
NVIDIA 团队利用 NemoClaw 构建了一个记忆驱动的“参谋长”智能体。该智能体通过维护一个名为“自我模型”的人类可读知识层来存储相关记忆,使 AI 能够理解并处理随时间变化的企业消息、决策、项目和职责等上下文信息。
NVIDIA 介绍了在 Jetson 边缘计算平台上部署和优化前沿推理模型的方法。此举旨在解决多步推理模型因体积过大而难以在边缘硬件本地运行的问题,使开发者能够构建不依赖数据中心、降低成本和保护本地数据的智能体。
NVIDIA 发布指南,阐述如何在跨越控制平面和数据平面的联邦 Kubernetes 与 AI 平台中实现用户身份的无缝传递。该方案旨在解决用户从中央门户访问受管数据集、启动 Notebook 到调用跨集群 AI 服务时,身份认证边界断裂的问题,从而提供统一的工作流体验。
Meta 推出 ZGateway 作为统一 ZippyDB 客户端流量的代理层,支持流量控制、负载均衡和跨区域容错等功能。ZGateway 作为无状态代理,可处理每秒超过 10 亿次操作,承载约 40% 的 ZippyDB 流量,仅增加约 6% 的计算开销。它通过 ServiceRouter 发现区域代理层,运行内部厚客户端作为引擎,实现请求路径中的 TLS 终止、授权、缓存和批量处理等操作。
NVIDIA PAIR Virtual Inference Router 可聚合本地网络中多个设备的算力,为 AI 智能体提供统一的推理资源池。该工具支持多智能体协同工作流,能提升复杂任务的完成速度。
Google DeepMind 发布 WeatherNext 3,引入实时卫星数据、每小时更新、5公里分辨率,提升降水预测精度,并集成至 Search、Gemini、Maps 等产品。该模型通过直接学习观测数据,实现更精准的局部天气预测,尤其改善了拉丁美洲、非洲和亚太地区覆盖。
推荐理由:原文给出了实时卫星数据接入、小时级更新和分辨率提升等关键变化,读者可据此评估其对气象服务的影响。
Fly.io 为其 Sprites 服务发布了 MCP 服务器,让 AI 智能体可以通过 MCP 协议动态创建和管理云端计算机。Sprites 是具备持久文件系统和真实网络连接的轻量级云计算机,旨在为 AI 智能体提供安全、可扩展且成本低廉的执行环境。用户可通过指定 URL 在 Claude Desktop 等支持 MCP 的工具中集成此功能,并利用预设的安全护栏控制资源使用。
NVIDIA 博客通过一个图像处理管道示例,分六步演示了如何利用现代 CUDA 工具链优化代码。步骤包括使用 CCCL API 和 Compute Sanitizer 查找索引错误、利用 NVTX 改进 Nsight Systems 基准测试、采用 CUB 优化算法、通过池化容器管理 GPU 内存、使用固定容器加速主机到设备的数据传输,以及为每个线程分配独立流以实现异步传输和并行化。
NVIDIA 提出通过推测解码加速大语言模型推理,并提供了在帕累托前沿选择草稿长度和草稿机制的五项指南。该方法旨在提升推理速度的同时保持模型准确性。
Google 启动 Fairwind 计划,为政府机构和可信合作伙伴提供其最先进的网络防御能力。该计划首先提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具,帮助防御者自主发现并修复漏洞,在数分钟内生成已验证的、可部署的补丁。全球已有超过 650 家合作伙伴参与该计划。
NVIDIA 介绍了如何利用其 Nemotron 模型构建自适应智能体网络安全系统,以应对传统安全方案难以发现的未知威胁。该系统通过协调智能体工作,能够执行长期复杂的安全目标,旨在超越依赖现有警报和预定义工作流的传统实现。
NVIDIA 提供了为 AI 推理工作负载配置 GPU 资源并优化总拥有成本(TCO)的指导。该方法旨在帮助组织在满足延迟目标、模型选择、流量模式和预算约束的同时,避免资源过度配置。
Anthropic 推出 Enterprise Frontier Safeguards (EFS),允许客户在自有云基础设施中存储数据并控制数据审查流程,以兼顾隐私与安全检测。
企业 AI 应用的实际成本不仅取决于模型单价,更取决于完成任务所需的 token 数量。Snowflake 的内部实验显示,在某些简单任务上,廉价开源模型的成本可比前沿模型低 59 倍;而 Databricks 的测试则表明,在复杂任务中,廉价模型因多次尝试失败,其单任务总成本可能反而高于更智能的昂贵模型。