NVIDIA NIM 全栈优化如何为 Nemotron 3 Ultra 实现 2.5 倍用户并发提升
NVIDIA NIM 通过全栈优化,使 Nemotron 3 Ultra 模型在保持交互性的前提下,支持的并发用户数提升了 2.5 倍。该优化对于提示词较长、需跨步骤复用上下文的智能体 AI 工作负载尤为重要。
NVIDIA NIM 通过全栈优化,使 Nemotron 3 Ultra 模型在保持交互性的前提下,支持的并发用户数提升了 2.5 倍。该优化对于提示词较长、需跨步骤复用上下文的智能体 AI 工作负载尤为重要。
Google Search 的 AI 功能可帮助跑者制定个性化训练计划、创建定制播放列表和选购合适装备。用户可通过 AI Mode 中的 Canvas 工具生成包含交叉训练和力量训练的详细日程,并连接 YouTube Music 账户获取跑步歌单。此外,借助涵盖超 600 亿产品列表的 Shopping Graph,Search 能提供符合预算等限制条件的装备推荐与比价。
Gemini 应用今日上线 Windows 平台,提供键盘快捷键调用、专用工作区和图像视频生成功能。用户可通过 Alt + Space 快速调用 Gemini,Gemini Spark 1 可处理多步骤任务,Gemini Omni 1 支持高质量视频创作,应用运行轻量且不影响 PC 性能。
Amazon Science 发布论文《What fits (into few tokens) doesn't overfit: Compression and generalization in ML research agents》。
NVIDIA BioNeMo Inference Runtime (BioIR) 加速了生物分子结构预测模型在 NVIDIA GPU 上的运行。它通过优化的内核和 CUDA Graphs 等技术提升模型推理速度,同时保持了熟悉的 PyTorch 工作流程,适用于蛋白质组规模的高通量预测任务。
Replit 与 Databricks 的集成现已正式发布,支持原生 Lakebase 数据库。该集成允许企业团队在 Replit 上构建应用,并通过 Databricks 管理和提供受控的实时企业数据访问。应用部署时,Replit Agent 自动创建 Lakebase 数据库,无需手动设置,同时支持预览部署和基于角色的访问控制。
NIST 研究人员利用量子传感器以空前精度测量了钚、铀和镎的干扰性 X 射线辐射,从而更准确地区分核材料的伽马射线和 X 射线光谱。新方法将 X 射线能量测量的不确定性降低了三分之一到八分之一,并可加速核材料成分分析,有助于提高核电站效率。NIST 已在多个能源部实验室及国际设施部署该传感器,正与 CERN 和 NASA 合作提升精度并简化冷却设备。
Mistral 与 Cloudera 建立合作伙伴关系,将 Mistral 的模型集成至 Cloudera 的混合数据平台。企业可在私有云、公有云、本地及完全隔离的环境中部署和运行推理,并利用自有专有数据训练定制化模型,保持对数据和生成智能的完全所有权与控制。此次合作旨在满足市场对主权 AI 日益增长的需求,确保数据、智能、计算和运营全程由客户掌控。
NVIDIA 利用其 Nemotron 大语言模型与 Palantir Foundry 平台,将复杂的全球供应链专业知识转化为可执行的代码。该系统旨在优化从晶圆产出到 AI 模型生成首个 token 的全流程效率,覆盖从芯片出厂到数据中心上架,再到软件栈部署的各个环节。
DeepSeek发布多模态Mixture-of-Experts模型DeepSeek-V4.1-Flash,拥有552B参数,支持最多100万token上下文。模型采用CED架构,通过SWA Bounded Replay和CSA2技术将全局KV缓存降至890字节/token,约为前代的1/4。
推荐理由:模型在KV缓存压缩和多模态能力上实现突破,支持百万token上下文和可调推理努力,对长上下文智能体应用有直接价值。
Together AI 推出抢占式计算功能,允许用户以标准按需算力价格的一半运行可中断任务,如实验、批量推理和微调。抢占式节点基于 NVIDIA 加速算力,使用未占用资源,可在五分钟后被回收,且无需额外申请替代资源。该功能当前仅支持 Kubernetes 集群,用户可通过控制台、CLI 或 API 设置抢占式算力目标并调度任务。
Together AI 在 NVIDIA Vera Rubin NVL72 平台上部署了 ThunderKittens 2.0 GEMM 内核,实现 NVFP4 和 FP8 矩阵乘法运算,但性能仅达到理论峰值的 42.1% 和 44.4%。
MIT Schwarzman College of Computing 启动了为期一周的 AI 教育者试点项目,旨在帮助来自多所大学的 19 名教育工作者将 AI 教学融入各自学科。该项目基于 MIT 的“建模与机器学习”课程,通过演示和实践活动,帮助教师掌握将核心 AI 概念与特定领域问题相结合的教学方法。其长期目标是建立一个教育者网络,扩大跨学科 AI 教育的覆盖面。
NVIDIA 介绍了使用 Encode-Prefill-Decode (EPD) 解耦技术来优化多模态模型推理。该技术将视觉编码器阶段与预填充和解码阶段分离,尤其适用于图像密集型提示词、中短输出及量化 MoE 模型。结合 NVIDIA Dynamo 使用,可实现高达 5 倍的推理加速。
Gemini 提供四种方式帮助用户快速处理行政事务,包括填写表格、参与公民生活、查找政府机构和获取社会服务信息。用户可通过提示词获取具体步骤和所需文件清单,如“注册纽约市购买的二手车需要哪些文件和费用”。超过 40% 的用户在处理政府事务时会咨询 Gemini,以理解复杂流程和术语。
Google DeepMind 与电影制作团队合作,在短片《Love, Rendered》中利用生成式 AI 技术重现了一对夫妇未曾被记录的初遇记忆。团队结合图像修复模型与表演捕捉模型,将老照片复原并映射了当事人当下的细微神态。该项目展示了 AI 作为艺术媒介的潜力,相关照片修复功能已集成至 Gemini 应用中。
Google Search 为美式橄榄球赛季推出多项新功能,包括实时比赛动态、更详细的球员与联盟统计数据,并支持关联 Yahoo Fantasy 或 Sleeper 账户以获取 AI 定制的阵容建议。实时动态功能目前在美国移动端提供,关联梦幻足球账户功能也仅限美国英语用户。
WRITER 推出 Enterprise Brain,这是一个受管控的通用上下文层,能动态捕获企业的品牌、制度知识、决策逻辑和实时业务数据,供所有团队和智能体实时使用。
WRITER 推出名为 Enterprise Brain 的共享上下文系统,旨在为整个营销和收入组织的 AI 智能体提供公司品牌、客户和市场策略知识。该系统智能捕获团队工作中学到的决策、客户信号以及公司既定的品牌指南、合规要求等两类关键上下文,并将其转化为智能体可用的共享基础。
Mistral AI 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 代码迁移至 C++,并重构了物理密集型的油藏模拟器架构。项目首先构建了数值对等性验证框架,确保新旧代码输出一致,并利用上百个 AI 智能体自动解析代码调用树、整合分散文档。通过采用“规划-编码-测试-评审”的多智能体工作流与人机协同检查点,最终在保障代码质量的同时完成了现代化重构。
Together AI 发布了一篇关于开源AI栈的深度指南,将栈分解为模型、推理、网关、工具等独立层,并解释了如何组合这些组件来构建自定义的AI开发工作流。
Weaviate 推出 HFresh,一种基于磁盘的向量索引,旨在通过降低内存使用支持更大规模的数据集。HFresh 借鉴 SPFresh 研究论文理念,采用分区策略并使用 HNSW 作为中心索引,实现高效的查询路由和可控的磁盘 I/O。该索引支持增量再平衡操作,避免了传统索引需要全量重建的问题,适用于对内存敏感且需处理大规模数据的应用场景。
决策轨迹记录了AI智能体在做出决策时的推理步骤、工具调用和上下文信息,使决策过程可追溯和可查询。这些信息存储在上下文图中,与对话、事实和其他相关数据保持连接,便于后续审查和分析。决策轨迹支持可解释性、调试、合规审查、一致性提升和跨智能体的知识共享。
LangChain 在 deepagents 框架中引入了 subagent 的两种上下文模式:isolated(隔离)和 fork(分叉)。isolated 模式下子智能体从零开始,仅接收任务描述;fork 模式下子智能体继承监督智能体的完整对话历史,避免重复上下文获取。
Google DeepMind发布AlphaGenome Atlas,包含对人类基因组中约90亿个单核苷酸变异的分子效应预测,通过AVI评分系统整合AlphaGenome与AlphaMissense模型,支持非编码区和编码区变异的统一评估。该资源已通过网站门户、AlphaGenome API及Google Antigravity技能开放,用于罕见病研究、复杂性状分析和基因调控机制探索。
推荐理由:原文提供了90亿个单核苷酸变异的预测数据和AVI评分系统,可直接用于罕见病研究和复杂性状分析。
Mistral AI 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,这是欧洲科技公司有史以来规模最大的股权融资轮。本轮融资由三星电子领投,将用于扩展其前沿研究、计算能力和基础设施,以构建集开放权重模型、基础设施和产品于一体的全栈主权AI解决方案。公司目前业务覆盖 20 个国家,为包括空客、ASML 和汇丰在内的超过 125 家全球企业的关键任务 AI 转型提供支持。
推荐理由:作为欧洲AI公司最大规模的单轮融资,这笔资金将用于扩展其全栈主权AI能力,反映了市场对可控、开放AI基础设施的需求变化。
NVIDIA 宣布将大力投入 Rust 原生 GPU 编程,并计划在 2027 年及以后持续发展和完善 CUDA Rust 工具链。此举旨在为不断变化的 AI 模型和技术提供从推理引擎到智能体运行时的系统层支持。
Building Foundry 第三部分介绍了如何将现有档案库转化为可搜索的创意资源库,通过只读扫描、准备元数据并同步至 Weaviate 实现。该流程生成包含文件名、路径、类型、标签、描述和源 URI 的记录,无需移动或重命名文件。用户可通过关键词、语义或混合搜索模式查找内容,并通过项目、文件类型等过滤器缩小范围。
面壁 MiniCPM 发布 JustRL-II-base-model,这是一个已预训练用于生成长链推理响应的小语言模型检查点。该模型在 AIME 2025 测试中得分为 61%,经过约 300 步强化学习后可提升至 81%。
Neo4j 发布 @neo4j-labs/nams-ai-provider 工具包,为 Vercel AI SDK 提供基于图数据库的持久化记忆功能,支持三种集成模式:Provider、Middleware 和 Tools,通过单行代码替换即可实现跨会话记忆,记忆内容以实体-关系图结构存储,支持检索、修正和合并实体,且保证在模型调用失败时不影响响应。
推荐理由:原文给出了集成代码示例和三种模式,读者可以据此判断如何在现有 Vercel AI SDK 项目中实现持久化记忆。
Neo4j 发布 Aura Agent 功能,实现 Salesforce Agentforce 与 Neo4j 知识图谱的无代码多智能体集成。该功能通过 MCP 协议连接,将图谱计算与工作流分离,使 Agentforce 仅需发送自然语言问题,Aura Agent 负责解析、执行 Cypher 查询并返回带证据的推荐结果,无需自定义代码。
Neo4j 发布 Neocarta 语义层,通过在 Neo4j 中构建跨 BigQuery 和 Databricks 的元数据图,使 Text2SQL 代理在 278 张 Census 表和 264 张 Databricks 表的复杂环境中。
推荐理由:原文展示了在大规模、复杂数据环境中,通过图结构语义层显著提升Text2SQL的准确性和成本效益,可直接复用于企业级数据接入场景。
本文展示了如何编写不会丢失数据的 Cypher 查询,通过构建三个测试用户(Beyoncé、Kelly 和 Michelle)来演示查询逻辑对数据可见性的影响。Michelle 的账户未被首次查询返回,因其没有完成课程的关联,而查询条件要求用户必须有指向课程的注册记录。修正后,查询直接锚定用户自身,通过允许空值的表达式返回所有用户信息,包括课程列表和完成数量。
面壁 MiniCPM 推出 UltraData-Code-L2-Classifier,一套针对 UltraData-Code-L1 中 11 种编程语言的文件级分类器,生成约 400B tokens 的 UltraData-Code-L2 数据集。
面壁 MiniCPM5-2B 模型发布,为2B参数量级的密集Transformer模型,支持131,072上下文长度,适用于本地部署和资源受限场景。模型在2B规模中达到开源SOTA,平均分53.9,优于同规模模型及部分4B模型,在编码、数学、长上下文、工具调用和智能体任务中表现突出。
NVIDIA 团队利用 NemoClaw 构建了一个记忆驱动的“参谋长”智能体。该智能体通过维护一个名为“自我模型”的人类可读知识层来存储相关记忆,使 AI 能够理解并处理随时间变化的企业消息、决策、项目和职责等上下文信息。
NVIDIA 介绍了在 Jetson 边缘计算平台上部署和优化前沿推理模型的方法。此举旨在解决多步推理模型因体积过大而难以在边缘硬件本地运行的问题,使开发者能够构建不依赖数据中心、降低成本和保护本地数据的智能体。
Google 的音乐生成模型 Lyria 3.5 已在 Gemini 应用和 Gemini API 中面向全球用户推出。该模型提供更具表现力的人声和更丰富的编曲,用户可在应用内选择流派、人声/器乐风格,并使用新模板快速创作。Lyria 3.5 也通过 Google Flow Music、Google AI Studio 和 Google Vids 提供给艺术家、开发者和技术人员使用。
LangChain 发布对 Model Context Protocol (MCP) 的新版支持,将 MCP 功能整合进主包 langchain.mcp,基于 FastMCP 构建,支持无状态协议、客户端缓存和中断式 elicitation。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
NVIDIA 发布指南,阐述如何在跨越控制平面和数据平面的联邦 Kubernetes 与 AI 平台中实现用户身份的无缝传递。该方案旨在解决用户从中央门户访问受管数据集、启动 Notebook 到调用跨集群 AI 服务时,身份认证边界断裂的问题,从而提供统一的工作流体验。