使用 Helion 为 vLLM 构建高性能可移植的线性后端
研究团队将 Helion 集成到 vLLM 的线性后端,以探索其自动调优的高层内核 DSL 如何提升大语言模型推理性能并降低内核实现复杂度。在 NVIDIA Hopper GPU 上,该后端通过逐形状调优与混合调度,在评估的模型中性能超越了 vLLM 默认的 CUTLASS 和 DeepGEMM 后端,部分工作负载的吞吐量提升超过 10%。
研究团队将 Helion 集成到 vLLM 的线性后端,以探索其自动调优的高层内核 DSL 如何提升大语言模型推理性能并降低内核实现复杂度。在 NVIDIA Hopper GPU 上,该后端通过逐形状调优与混合调度,在评估的模型中性能超越了 vLLM 默认的 CUTLASS 和 DeepGEMM 后端,部分工作负载的吞吐量提升超过 10%。
Meta 团队使用 TLX 在 NVIDIA Blackwell 上优化了其生成式广告模型 GEM 的 Jagged Flash Attention 内核。该 TLX 内核代码量约为 3.2K 行,比当前 SOTA 的 FlashAttention-4 少约 3 倍,并在 GEM 关键的不规则形状上,前向传递性能提升约 13%,反向传递提升约 50%。
微软研究院开发了一套端到端机器学习系统,可为美国本土 66,935 座变电站提供提前 30 至 60 分钟的位置特定空间天气风险预测。该系统结合太阳风观测、AE/Dst 指数预报、地质电导率与电网数据,在 2020-2026 年评估期内对重大事件的检测率达到 76.5%。
Jev 决策模型在边缘服务编排中替代大语言模型,将中位决策延迟降低 22.7-64.5%。其延迟几乎不受输入规模、合同宽度或目录规模影响,在四字段合同中每项正确决策的 API 费用降低 59.7-80.9%,但精确匹配点略有下降。Jev 能准确识别未见过的服务,并在实时准入路径中保持 0.91-0.95 的请求准确率和准时率,而大语言模型在同等负载下低于 0.1。
NVIDIA 与 SGLang 团队合作开发了 SWE-Serve,用于评估 AI 编码智能体生成的补丁在推理服务软件中的实际表现。该基准包含 53 个任务,旨在检查补丁能否在服务器加载真实模型并处理请求的完整服务路径中正常工作,而不仅是通过本地测试。
GTR 是一种无需 softmax 的视觉主干模型,结合门控线性注意力、交替空间扫描方向和空间增强的 SwiGLU 模块,用于高效密集预测。GTR-L 在 COCO val2017 上达到 58.9 box AP,使用 RTX 4090 编译后的 FP16 执行时,单批次推理延迟为 1.908 ms。
NVIDIA TensorRT Edge-LLM 在 Jetson AGX Thor 平台上运行 MLPerf Edge Agentic Benchmark,推理速度比基准快 6.4 倍。该基准测试模拟了 AI 智能体在边缘设备(如车辆、机器人)上执行多步骤任务的工作流。
单相直接液冷技术被证实适用于未来十年的超高密度计算,通过在高热组件上安装冷板并循环水或水-乙二醇冷却液,有效吸收并快速移除热量。该技术相比风冷和浸没式冷却,在高密度服务器节点和高功率机架场景下能支持更高的芯片和机架密度,同时减少占地面积。随着AI加速器单机功耗超过1,000瓦、单机架散热超过100千瓦,液冷成为数据中心设计的关键挑战解决方案。
Neo4j 发布 Neocarta 语义层,通过在 Neo4j 中构建跨 BigQuery 和 Databricks 的元数据图,使 Text2SQL 代理在 278 张 Census 表和 264 张 Databricks 表的复杂环境中。
推荐理由:原文展示了在大规模、复杂数据环境中,通过图结构语义层显著提升Text2SQL的准确性和成本效益,可直接复用于企业级数据接入场景。
巴基斯坦对1,559名试用法官开展JudgeGPT试点,该工具基于GPT-4与12.8万份判例及943部法规构建,结合RAG技术辅助法律检索与判决起草。研究显示,经系统培训的法官所在辖区案件解决率提升6.3%,且判决质量未下降,每投入1美元可节省约38.50美元司法成本。培训显著提升工具使用频率与持续性,但仍有约五分之一的法官存在过度依赖AI现象。
推荐理由:原文通过实证研究呈现了AI工具在司法系统中的实际应用效果,为公共部门AI落地提供了可参考的评估框架。
伯克利 AI 研究团队扩展了 K-Search 框架,为其增加了 MLX 后端,并开发了一个结构化的 CUDA-to-MLX 翻译层,能够将 NVIDIA CUDA 内核的优化知识自动迁移到 Apple Silicon 上。
推荐理由:研究提出了一种将 NVIDIA CUDA 内核优化知识自动迁移到 Apple MLX 框架的方法,为跨硬件生态的 AI 计算性能优化提供了新思路。
Together AI 开源了智能体推理系统 ThunderAgent,通过将工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。在 8 节点 H100 集群上,相比 SGLang Gateway 实现了 2.39 倍的加速和接近线性的吞吐扩展。该系统与 OpenAI 兼容,只需在客户端添加 `program_id` 字段即可集成现有推理后端。
推荐理由:开源系统通过将智能体工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。
MIT 的 JARVIS 挑战赛让学生团队在四周内使用 AI 作为主要工程伙伴,设计、制造并测试小型喷气发动机。研究发现,AI 能显著加速安全关键硬件工程,但工程判断仍是决定性因素,而制造环节仍是根本性的速率限制步骤。获胜团队更依赖基础知识和团队合作,而非 AI。
Together AI 在 ICML 2026 展示了涵盖智能体到 GPU 内核的全栈前沿研究成果。其 DSGym 框架包含 1000+ 个跨 10+ 领域的数据科学任务评估套件,ThunderAgent 将智能体推理吞吐量提升最高 3.6 倍。
Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,用于评估大模型编写跨 GPU 通信 CUDA 内核的能力。在 87 个真实代码问题中,表现最佳的 GPT-5.5 在单次尝试下仅正确解决 28 个问题,其中仅 22 个快于 PyTorch + NCCL 基线。研究揭示了模型在协调 GPU 间通信、数据分区和选择最优传输机制方面存在根本性困难。
Together AI 推出首个针对高并发编码智能体工作负载的推理基准测试,模拟 45k 至 200k token 的长上下文输入和平均 450 token 的生成任务。
自适应并行推理让推理模型能自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们。这种方法旨在解决顺序推理因探索路径线性增长而导致的延迟增加、计算密集和上下文窗口受限问题。研究分析了从固定并行到自适应控制的各种方法,指出让模型根据问题自适应决策是提升并行化效果的关键。
Together AI 推出的 distribution-aware speculative decoding (DAS) 框架将 RL 后训练中的 rollout 阶段速度提升了最高 50%,且不影响模型输出质量。该框架包含自适应后缀树草稿器和长度感知调度策略,在 DeepSeek-R1-Distill-Qwen-7B 的数学推理任务中实现了超过 50% 的 rollout 时间缩减。
Together AI 的研究论文展示了如何利用 LLM 优化数据库查询执行计划。其 DBPlanBench 框架将 Apache DataFusion 的物理执行计划序列化后交由 LLM 分析,通过生成 JSON Patch 进行局部调整,而非重写整个计划。
一项研究发现,采用精心设计的“分而治之”框架,Llama-3-70B 或 Qwen-72B 等较弱模型在长上下文任务上的表现可以匹配甚至超越 GPT-4o 的单次处理模式。该框架通过规划器、并行工作器和聚合管理器分解任务,有效降低了因上下文过长导致的模型混淆、任务依赖和聚合噪声。这种方法在问答、检索和摘要等任务中更具成本效益和速度优势,但高度依赖跨块上下文的任务仍适合使用单次处理的强大模型。
Together AI 联合多所大学的研究人员发布了 Mamba-3,这是一个以推理效率为主要目标的新状态空间模型。Mamba-3 通过更复杂的循环公式、复数值状态跟踪和 MIMO 变体提升了性能,其 SISO 版本在 1.5B 规模上,所有序列长度的预填充+解码延迟均优于 Mamba-2、Gated DeltaNet 和 Llama-3.2-1B。
推荐理由:Mamba-3 将设计目标从训练效率转向推理效率,并开源了内核,为关注部署性能的开发者提供了新的架构选择。
Berkeley AI Research 提出了 SPEX 和 ProxySPEX 算法,用于大规模识别驱动大语言模型决策的关键交互作用。SPEX 利用稀疏性和低阶性将搜索问题转化为可解的稀疏恢复问题,而 ProxySPEX 则利用层次结构特性,能以约 10 倍更少的消融操作达到与 SPEX 相当的性能。这些框架能高效应用于特征归因、数据归因和模型组件归因,提升模型的可解释性。
针对视频扩散模型长序列处理的 Ulysses 上下文并行方法,通过异步执行和融合投影优化了通信与计算的重叠。在 8 块 B200 GPU 的基准测试中,异步 Ulysses 使预注意力块延迟降低约 23–25%,端到端性能提升约 3%;融合 QKV 投影在 2-4 GPU 配置下将块延迟进一步降低 33-37%。实验表明,重叠是稳健的高规模默认方案,而融合在中低规模下效果最强。
Vector 研究人员在 NeurIPS 2025 会议上提交了 80 篇论文,涵盖下一代基础模型、扩散生成系统、强化学习突破和隐私保护联邦方法等多个领域。其中提出 ActiveVOI 框架,用于开放世界智能体的主动知识获取,显著优于现有基于大语言模型和视觉语言模型的规划方法。另一项研究引入连续时间流图蒸馏方法,通过自引导和对抗微调提升性能,适用于不同步数的生成任务。