跳到正文
10月3日周六
  1. PyTorch 博客42

    使用 Helion 为 vLLM 构建高性能可移植的线性后端

    研究团队将 Helion 集成到 vLLM 的线性后端,以探索其自动调优的高层内核 DSL 如何提升大语言模型推理性能并降低内核实现复杂度。在 NVIDIA Hopper GPU 上,该后端通过逐形状调优与混合调度,在评估的模型中性能超越了 vLLM 默认的 CUTLASS 和 DeepGEMM 后端,部分工作负载的吞吐量提升超过 10%。

10月2日周五
10月1日周四
9月26日周六
  1. Hugging Face · 每日论文35

    用 Jev 决策模型替代大语言模型以实现低延迟边缘服务编排

    Jev 决策模型在边缘服务编排中替代大语言模型,将中位决策延迟降低 22.7-64.5%。其延迟几乎不受输入规模、合同宽度或目录规模影响,在四字段合同中每项正确决策的 API 费用降低 59.7-80.9%,但精确匹配点略有下降。Jev 能准确识别未见过的服务,并在实时准入路径中保持 0.91-0.95 的请求准确率和准时率,而大语言模型在同等负载下低于 0.1。

9月24日周四
9月23日周三
9月17日周四
9月16日周三
  1. IEEE Spectrum · AI14

    单相直接液冷技术被证实适用于未来十年的超高密度计算

    单相直接液冷技术被证实适用于未来十年的超高密度计算,通过在高热组件上安装冷板并循环水或水-乙二醇冷却液,有效吸收并快速移除热量。该技术相比风冷和浸没式冷却,在高密度服务器节点和高功率机架场景下能支持更高的芯片和机架密度,同时减少占地面积。随着AI加速器单机功耗超过1,000瓦、单机架散热超过100千瓦,液冷成为数据中心设计的关键挑战解决方案。

9月7日周一
  1. Neo4j 博客64

    Neo4j 发布 Neocarta 语义层,降低 Text2SQL token 消耗最高达 81%

    Neo4j 发布 Neocarta 语义层,通过在 Neo4j 中构建跨 BigQuery 和 Databricks 的元数据图,使 Text2SQL 代理在 278 张 Census 表和 264 张 Databricks 表的复杂环境中。

    推荐理由:原文展示了在大规模、复杂数据环境中,通过图结构语义层显著提升Text2SQL的准确性和成本效益,可直接复用于企业级数据接入场景。

8月12日周三
  1. IEEE Spectrum · AI61

    巴基斯坦司法系统试点JudgeGPT提升案件处理效率

    巴基斯坦对1,559名试用法官开展JudgeGPT试点,该工具基于GPT-4与12.8万份判例及943部法规构建,结合RAG技术辅助法律检索与判决起草。研究显示,经系统培训的法官所在辖区案件解决率提升6.3%,且判决质量未下降,每投入1美元可节省约38.50美元司法成本。培训显著提升工具使用频率与持续性,但仍有约五分之一的法官存在过度依赖AI现象。

    推荐理由:原文通过实证研究呈现了AI工具在司法系统中的实际应用效果,为公共部门AI落地提供了可参考的评估框架。

7月29日周三
  1. Berkeley AI Research57

    伯克利研究:K-Search 通过 CUDA 到 MLX 的翻译层将内核优化知识迁移至 Apple Silicon

    伯克利 AI 研究团队扩展了 K-Search 框架,为其增加了 MLX 后端,并开发了一个结构化的 CUDA-to-MLX 翻译层,能够将 NVIDIA CUDA 内核的优化知识自动迁移到 Apple Silicon 上。

    推荐理由:研究提出了一种将 NVIDIA CUDA 内核优化知识自动迁移到 Apple MLX 框架的方法,为跨硬件生态的 AI 计算性能优化提供了新思路。

  2. Together AI63

    Together AI 开源 ThunderAgent,实现 2 倍吞吐的智能体推理系统

    Together AI 开源了智能体推理系统 ThunderAgent,通过将工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。在 8 节点 H100 集群上,相比 SGLang Gateway 实现了 2.39 倍的加速和接近线性的吞吐扩展。该系统与 OpenAI 兼容,只需在客户端添加 `program_id` 字段即可集成现有推理后端。

    推荐理由:开源系统通过将智能体工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。

7月15日周三
  1. MIT News · 人工智能52

    MIT JARVIS 挑战赛测试 AI 副驾驶在喷气发动机设计中的角色

    MIT 的 JARVIS 挑战赛让学生团队在四周内使用 AI 作为主要工程伙伴,设计、制造并测试小型喷气发动机。研究发现,AI 能显著加速安全关键硬件工程,但工程判断仍是决定性因素,而制造环节仍是根本性的速率限制步骤。获胜团队更依赖基础知识和团队合作,而非 AI。

6月30日周二
6月23日周二
  1. Together AI62

    Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,前沿模型表现不佳

    Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,用于评估大模型编写跨 GPU 通信 CUDA 内核的能力。在 87 个真实代码问题中,表现最佳的 GPT-5.5 在单次尝试下仅正确解决 28 个问题,其中仅 22 个快于 PyTorch + NCCL 基线。研究揭示了模型在协调 GPU 间通信、数据分区和选择最优传输机制方面存在根本性困难。

5月19日周二
5月8日周五
  1. Berkeley AI Research35

    自适应并行推理:高效推理扩展的下一个范式

    自适应并行推理让推理模型能自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们。这种方法旨在解决顺序推理因探索路径线性增长而导致的延迟增加、计算密集和上下文窗口受限问题。研究分析了从固定并行到自适应控制的各种方法,指出让模型根据问题自适应决策是提升并行化效果的关键。

4月24日周五
  1. Together AI44

    Together AI 发布 distribution-aware speculative decoding 框架,将 RL 训练 rollout 速度提升最高 50%

    Together AI 推出的 distribution-aware speculative decoding (DAS) 框架将 RL 后训练中的 rollout 阶段速度提升了最高 50%,且不影响模型输出质量。该框架包含自适应后缀树草稿器和长度感知调度策略,在 DeepSeek-R1-Distill-Qwen-7B 的数学推理任务中实现了超过 50% 的 rollout 时间缩减。

4月3日周五
3月26日周四
  1. Together AI49

    Together AI 研究:弱模型如何通过“分而治之”框架在长上下文任务中超越 GPT-4o

    一项研究发现,采用精心设计的“分而治之”框架,Llama-3-70B 或 Qwen-72B 等较弱模型在长上下文任务上的表现可以匹配甚至超越 GPT-4o 的单次处理模式。该框架通过规划器、并行工作器和聚合管理器分解任务,有效降低了因上下文过长导致的模型混淆、任务依赖和聚合噪声。这种方法在问答、检索和摘要等任务中更具成本效益和速度优势,但高度依赖跨块上下文的任务仍适合使用单次处理的强大模型。

3月17日周二
  1. Together AI61

    Together AI 发布 Mamba-3 状态空间模型

    Together AI 联合多所大学的研究人员发布了 Mamba-3,这是一个以推理效率为主要目标的新状态空间模型。Mamba-3 通过更复杂的循环公式、复数值状态跟踪和 MIMO 变体提升了性能,其 SISO 版本在 1.5B 规模上,所有序列长度的预填充+解码延迟均优于 Mamba-2、Gated DeltaNet 和 Llama-3.2-1B。

    推荐理由:Mamba-3 将设计目标从训练效率转向推理效率,并开源了内核,为关注部署性能的开发者提供了新的架构选择。

3月13日周五
  1. Berkeley AI Research32

    Berkeley AI Research 提出 SPEX 与 ProxySPEX:大规模识别 LLM 中的交互作用

    Berkeley AI Research 提出了 SPEX 和 ProxySPEX 算法,用于大规模识别驱动大语言模型决策的关键交互作用。SPEX 利用稀疏性和低阶性将搜索问题转化为可解的稀疏恢复问题,而 ProxySPEX 则利用层次结构特性,能以约 10 倍更少的消融操作达到与 SPEX 相当的性能。这些框架能高效应用于特征归因、数据归因和模型组件归因,提升模型的可解释性。

2月24日周二
  1. fal 博客31

    Ulysses 上下文并行:通信与计算重叠的实验

    针对视频扩散模型长序列处理的 Ulysses 上下文并行方法,通过异步执行和融合投影优化了通信与计算的重叠。在 8 块 B200 GPU 的基准测试中,异步 Ulysses 使预注意力块延迟降低约 23–25%,端到端性能提升约 3%;融合 QKV 投影在 2-4 GPU 配置下将块延迟进一步降低 33-37%。实验表明,重叠是稳健的高规模默认方案,而融合在中低规模下效果最强。

12月3日周三
  1. Vector Institute13

    Vector 研究人员在 NeurIPS 2025 发表 80 篇论文,推动 AI 前沿发展

    Vector 研究人员在 NeurIPS 2025 会议上提交了 80 篇论文,涵盖下一代基础模型、扩散生成系统、强化学习突破和隐私保护联邦方法等多个领域。其中提出 ActiveVOI 框架,用于开放世界智能体的主动知识获取,显著优于现有基于大语言模型和视觉语言模型的规划方法。另一项研究引入连续时间流图蒸馏方法,通过自引导和对抗微调提升性能,适用于不同步数的生成任务。