NVIDIA NIM 全栈优化如何为 Nemotron 3 Ultra 实现 2.5 倍用户并发提升
NVIDIA NIM 通过全栈优化,使 Nemotron 3 Ultra 模型在保持交互性的前提下,支持的并发用户数提升了 2.5 倍。该优化对于提示词较长、需跨步骤复用上下文的智能体 AI 工作负载尤为重要。
NVIDIA NIM 通过全栈优化,使 Nemotron 3 Ultra 模型在保持交互性的前提下,支持的并发用户数提升了 2.5 倍。该优化对于提示词较长、需跨步骤复用上下文的智能体 AI 工作负载尤为重要。
Google Search 的 AI 功能可帮助跑者制定个性化训练计划、创建定制播放列表和选购合适装备。用户可通过 AI Mode 中的 Canvas 工具生成包含交叉训练和力量训练的详细日程,并连接 YouTube Music 账户获取跑步歌单。此外,借助涵盖超 600 亿产品列表的 Shopping Graph,Search 能提供符合预算等限制条件的装备推荐与比价。
Together AI 在 NVIDIA Vera Rubin NVL72 平台上部署了 ThunderKittens 2.0 GEMM 内核,实现 NVFP4 和 FP8 矩阵乘法运算,但性能仅达到理论峰值的 42.1% 和 44.4%。
NVIDIA 介绍了使用 Encode-Prefill-Decode (EPD) 解耦技术来优化多模态模型推理。该技术将视觉编码器阶段与预填充和解码阶段分离,尤其适用于图像密集型提示词、中短输出及量化 MoE 模型。结合 NVIDIA Dynamo 使用,可实现高达 5 倍的推理加速。
Gemini 提供四种方式帮助用户快速处理行政事务,包括填写表格、参与公民生活、查找政府机构和获取社会服务信息。用户可通过提示词获取具体步骤和所需文件清单,如“注册纽约市购买的二手车需要哪些文件和费用”。超过 40% 的用户在处理政府事务时会咨询 Gemini,以理解复杂流程和术语。
Mistral AI 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 代码迁移至 C++,并重构了物理密集型的油藏模拟器架构。项目首先构建了数值对等性验证框架,确保新旧代码输出一致,并利用上百个 AI 智能体自动解析代码调用树、整合分散文档。通过采用“规划-编码-测试-评审”的多智能体工作流与人机协同检查点,最终在保障代码质量的同时完成了现代化重构。
Together AI 发布了一篇关于开源AI栈的深度指南,将栈分解为模型、推理、网关、工具等独立层,并解释了如何组合这些组件来构建自定义的AI开发工作流。
决策轨迹记录了AI智能体在做出决策时的推理步骤、工具调用和上下文信息,使决策过程可追溯和可查询。这些信息存储在上下文图中,与对话、事实和其他相关数据保持连接,便于后续审查和分析。决策轨迹支持可解释性、调试、合规审查、一致性提升和跨智能体的知识共享。
LangChain 在 deepagents 框架中引入了 subagent 的两种上下文模式:isolated(隔离)和 fork(分叉)。isolated 模式下子智能体从零开始,仅接收任务描述;fork 模式下子智能体继承监督智能体的完整对话历史,避免重复上下文获取。
Building Foundry 第三部分介绍了如何将现有档案库转化为可搜索的创意资源库,通过只读扫描、准备元数据并同步至 Weaviate 实现。该流程生成包含文件名、路径、类型、标签、描述和源 URI 的记录,无需移动或重命名文件。用户可通过关键词、语义或混合搜索模式查找内容,并通过项目、文件类型等过滤器缩小范围。
Neo4j 发布 Aura Agent 功能,实现 Salesforce Agentforce 与 Neo4j 知识图谱的无代码多智能体集成。该功能通过 MCP 协议连接,将图谱计算与工作流分离,使 Agentforce 仅需发送自然语言问题,Aura Agent 负责解析、执行 Cypher 查询并返回带证据的推荐结果,无需自定义代码。
本文展示了如何编写不会丢失数据的 Cypher 查询,通过构建三个测试用户(Beyoncé、Kelly 和 Michelle)来演示查询逻辑对数据可见性的影响。Michelle 的账户未被首次查询返回,因其没有完成课程的关联,而查询条件要求用户必须有指向课程的注册记录。修正后,查询直接锚定用户自身,通过允许空值的表达式返回所有用户信息,包括课程列表和完成数量。
NVIDIA 团队利用 NemoClaw 构建了一个记忆驱动的“参谋长”智能体。该智能体通过维护一个名为“自我模型”的人类可读知识层来存储相关记忆,使 AI 能够理解并处理随时间变化的企业消息、决策、项目和职责等上下文信息。
NVIDIA 介绍了在 Jetson 边缘计算平台上部署和优化前沿推理模型的方法。此举旨在解决多步推理模型因体积过大而难以在边缘硬件本地运行的问题,使开发者能够构建不依赖数据中心、降低成本和保护本地数据的智能体。
NVIDIA 发布指南,阐述如何在跨越控制平面和数据平面的联邦 Kubernetes 与 AI 平台中实现用户身份的无缝传递。该方案旨在解决用户从中央门户访问受管数据集、启动 Notebook 到调用跨集群 AI 服务时,身份认证边界断裂的问题,从而提供统一的工作流体验。
Meta 推出 ZGateway 作为统一 ZippyDB 客户端流量的代理层,支持流量控制、负载均衡和跨区域容错等功能。ZGateway 作为无状态代理,可处理每秒超过 10 亿次操作,承载约 40% 的 ZippyDB 流量,仅增加约 6% 的计算开销。它通过 ServiceRouter 发现区域代理层,运行内部厚客户端作为引擎,实现请求路径中的 TLS 终止、授权、缓存和批量处理等操作。
Neo4j 新工具 Document Intelligence 可将非结构化 PDF 文档转换为图数据库,用于生成家庭作业问答对。该方法在免费版 Aura 中可用,通过手动定义包含“问题”和“答案”节点的图模型实现。用户可选择免费方案或集成 OpenAI、Bedrock 等 API 来评估回答。
NVIDIA 博客通过一个图像处理管道示例,分六步演示了如何利用现代 CUDA 工具链优化代码。步骤包括使用 CCCL API 和 Compute Sanitizer 查找索引错误、利用 NVTX 改进 Nsight Systems 基准测试、采用 CUB 优化算法、通过池化容器管理 GPU 内存、使用固定容器加速主机到设备的数据传输,以及为每个线程分配独立流以实现异步传输和并行化。
NVIDIA 提出通过推测解码加速大语言模型推理,并提供了在帕累托前沿选择草稿长度和草稿机制的五项指南。该方法旨在提升推理速度的同时保持模型准确性。
NVIDIA 介绍了如何利用其 Nemotron 模型构建自适应智能体网络安全系统,以应对传统安全方案难以发现的未知威胁。该系统通过协调智能体工作,能够执行长期复杂的安全目标,旨在超越依赖现有警报和预定义工作流的传统实现。
NVIDIA 提供了为 AI 推理工作负载配置 GPU 资源并优化总拥有成本(TCO)的指导。该方法旨在帮助组织在满足延迟目标、模型选择、流量模式和预算约束的同时,避免资源过度配置。
Weaviate 提供一种无需OCR的RAG方法,通过多向量模型直接处理PDF页面图像,提取图表和表格中的语义信息。该方法将每页作为独立对象嵌入,利用MaxSim匹配查询与页面区域,支持拖拽上传和Python部署。示例中对NVIDIA财报的查询返回了包含趋势图表的页面,Query Agent可生成带图像引用的合成答案。
企业 AI 的知识层通过图结构建模运营组织,解决责任归属、流程执行等实际问题。Neo4j 图智能平台将业务单元、团队、角色和人员关系存储为可查询的图数据,帮助 AI 智能体准确理解业务流程中的权责关系。该层设计依赖于系统记录(如 Workday、BambooHR)的数据映射,并通过治理机制确保实体一致性、来源可追溯和结构验证。
Going Meta 第三季回顾了如何通过本体构建和评估来提升 AI 智能体性能,展示了 Neo4j 的 MCP 服务器和 Agent 技能在本体创建中的应用。本季重点探讨了本体作为智能体行为指导的实践,包括使用 SHACL 验证图结构、通过 Cypher 检查和仪表盘评估本体质量,并介绍了如何通过本体驱动智能体记忆与推理。相关代码、查询和数据集已上传至 GitHub 仓库。
Factory 通过集成自托管 LangSmith 实现了对自主大语言模型(LLM)系统反馈循环的自动化,从而将迭代速度提升 2 倍。LangSmith 提供了自定义追踪和反馈 API,使 Factory 能够将日志与 AWS CloudWatch 集成,精准调试上下文感知问题并优化提示词。
Replit Agent 通过复杂工作流对 LangSmith 的可观测性功能提出更高要求,促使其改进大规模追踪性能和前端渲染能力。新增的“在追踪内搜索”功能允许用户直接按关键词过滤追踪内容,大幅缩短调试时间。线程视图支持多轮对话中多个追踪的整合,帮助 Replit 更好地识别用户卡点和需要人工干预的环节。
Podium 使用 LangSmith 优化其 AI Employee 智能体行为,减少 90% 的工程干预。通过构建测试数据集、离线评估和实时反馈机制,Podium 提升了模型对对话结束点的识别能力,F1 分数从 91.7% 提升至 98.6%。LangSmith 提供的追踪功能帮助技术支持团队快速定位问题根源,区分应用错误、上下文缺失或模型对齐问题。
LangSmith 和 LangChain OSS 提供工具帮助满足欧盟 AI 法规对高风险 AI 系统的要求,包括完整执行追踪、自动事件日志、透明决策和人类监督机制。其支持端到端追踪、自定义评估器和人类干预路径,适用于金融、医疗等关键领域。产品提供自托管、BYOC 和云端部署选项,确保数据合规存储与访问。
LangSmith 推出自我优化的 LLM-as-a-Judge 评估系统,通过存储人类对评估结果的修正作为少样本示例,使评估器在后续迭代中自动适应。该系统减少对提示工程的依赖,适用于检测 RAG 幻觉、答案正确性及毒性内容等场景。用户可免费注册 LangSmith 尝试该功能,评估器支持在线和离线模式,配置简便且能随时间改进。
LangChain 重构了 chat.langchain.com 聊天机器人,采用 createAgent 和 Deep Agent 两种架构,分别用于快速文档问答和深度代码分析。新系统通过直接调用文档、知识库和代码库的 API,实现精准引用和上下文优化,支持多模型切换与实时流式响应,已在生产环境上线。
Neo4j Aura 提供了初创公司构建图应用的完整指南,包括安装工具、实例配置和常见错误避免。使用 neo4j-cli 安装所有技能并开启自动刷新,确保技能与 Neo4j 功能同步更新。通过 GraphRAG、MCP 服务器、GDS 和 Agent Memory 等工具,可逐步构建图应用并优化性能。
AI Agent Latency 101 介绍了开发者如何通过识别瓶颈、优化 UX 和减少 LLM 调用次数来提升 AI Agent 速度。文章指出,使用 LangSmith 可以追踪每个步骤的延迟,并通过“瀑布流”视图识别主要延迟来源;同时建议通过流式返回结果和在后台运行 Agent 来减少用户感知的延迟。
Candidly 基于 LangSmith 构建了状态感知智能体,通过分析对话轨迹中的用户行为与代理响应特征,训练出一个输入-输出隐马尔可夫模型,实现对对话状态的实时推断,并据此动态调整响应策略,提升任务完成率。该方法将评估信号转化为控制信号,适用于多轮交互场景中的实时干预。
推荐理由:原文详细展示了如何将对话分析转化为可实时干预的策略,为构建状态感知型智能体提供了可复用的方法论。
LangChain 官方发布教程,展示如何使用 Perplexity Agent API、LangGraph 和 LangSmith 构建可审计的 VC 研究智能体。
推荐理由:原文展示了如何用 Perplexity Agent API 和 LangGraph 构建可审计的投资研究智能体,提供了可复用的架构与实现路径。
LangChain 与 You.com 联合发布基于 Deep Agents 和 Finance Research API 的金融研究智能体框架,支持对欧盟27国2025年GDP数据进行自动化分析,实现异常检测、行业归因与可审计报告生成,完整执行过程通过 LangSmith 可视化追踪,提供可复现、可验证的AI研究工作流。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
LangChain 与 Pay-i 联合展示如何通过智能体 AI 在金融服务中证明投资回报,重点分析 RFP 处理和 AML 合规监控两个用例。LangSmith 提供智能体执行的全链路追踪,包括模型调用、工具调用和成本计算,而 Pay-i 将智能体成本与可衡量的业务成果关联,定义并跟踪如需求提取准确率(目标 95%)和响应草案无需重大修改率(目标 65%)等关键 KPI。
Harmonic 用 Deep Agents 重构其 AI 产品 Scout,将产品迭代周期从月级缩短至天级,通过单个前沿模型与工具集成实现开放任务处理,支持跨数据层与企业上下文的多步推理。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
LangSmith Engine 发布,是一个运行在代理追踪数据之上的智能体,可识别重复失败模式、生成可操作问题、提出评估器和数据集示例,并支持与代码库连接以推动修复。该工具通过轨迹压缩、分阶段筛查和专用子代理架构,实现对大规模追踪数据的高效分析,已在 LangChain 内部投入使用。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
GraphSAGE 是一种归纳式嵌入模型,通过采样节点邻居、聚合邻居特征并结合自身特征生成嵌入向量。其核心公式为 embedding = activation(W * AVG[own_feature, neighbor_summary] + b),其中 W 和 b 是模型在训练过程中学习的参数。该方法支持监督和非监督学习模式,可用于预测节点属性或仅基于图结构进行训练。
GraphSAGE 允许在新增节点时不重新训练整个图谱,直接生成嵌入向量。Aura Graph Analytics 提供模型存储功能,支持复用训练好的 GraphSAGE 模型处理新数据。文章演示了如何在合成电商图谱上训练 GraphSAGE,并用其为从未见过的新客户生成嵌入,无需重新训练。