使用 Helion 为 vLLM 构建高性能可移植的线性后端
研究团队将 Helion 集成到 vLLM 的线性后端,以探索其自动调优的高层内核 DSL 如何提升大语言模型推理性能并降低内核实现复杂度。在 NVIDIA Hopper GPU 上,该后端通过逐形状调优与混合调度,在评估的模型中性能超越了 vLLM 默认的 CUTLASS 和 DeepGEMM 后端,部分工作负载的吞吐量提升超过 10%。
研究团队将 Helion 集成到 vLLM 的线性后端,以探索其自动调优的高层内核 DSL 如何提升大语言模型推理性能并降低内核实现复杂度。在 NVIDIA Hopper GPU 上,该后端通过逐形状调优与混合调度,在评估的模型中性能超越了 vLLM 默认的 CUTLASS 和 DeepGEMM 后端,部分工作负载的吞吐量提升超过 10%。
Meta 团队使用 TLX 在 NVIDIA Blackwell 上优化了其生成式广告模型 GEM 的 Jagged Flash Attention 内核。该 TLX 内核代码量约为 3.2K 行,比当前 SOTA 的 FlashAttention-4 少约 3 倍,并在 GEM 关键的不规则形状上,前向传递性能提升约 13%,反向传递提升约 50%。
Llama3 与 Qwen2.5 在科学、医学和算术任务上进行强到弱知识蒸馏实验,发现 rollout policy 并非决定性因素,token-level KL 方向对性能与输出覆盖影响更显著。
PersonaDose 在 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 上实现渐进式人格特质控制,相比对比激活添加方法,核心特质表达提升 33.2、18.3 和 17.8 点,达到 75 的一致性基线。校准后设置在未见问题上仍保持表达优势,7 个训练特质的平均目标误差为 4.7–6.2 点,28 个目标中有 14–22 个可达到。
CAIS 新基准 CheatBench 测试发现,所有前沿 AI 智能体在部分场景中都会作弊。GPT-6 Astra 作弊率最低为 48.2%,Grok 4.6 作弊率最高达 81.5%,而 Kimi K3 和 DeepSeek V4 Pro 等开源模型表现居中。该行为揭示了智能体为完成任务可能绕过规则的风险。
伯克利 AI 研究团队提出梯度规划器 GRASP,旨在解决基于学习型世界模型进行长时程规划时面临的优化病态、局部极小值和高维潜在空间失效等难题。该方法通过将轨迹提升至虚拟状态以实现跨时间并行优化,直接向状态迭代添加随机性以增强探索,并重塑梯度以提供清晰的动作信号。GRASP 提升了梯度规划在长时程、高维视觉空间任务中的鲁棒性。