Hugging Face · 每日论文·· 3 天前AI 评分41
SparseDecoding: 解码感知的稀疏化框架提升大语言模型推理效率
SparseDecoding: Decoding-Aware Pruning for Accurate and Efficient LLM Inference
AI 导读
SparseDecoding 提出一种解码感知的稀疏化框架,通过使用生成过程中收集的激活数据对齐剪枝目标,提升大语言模型推理准确性与效率。该方法在 Llama-3.1-8B、Llama-3.3-70B、Qwen3-14B / 32B 等模型上实现高达 1.48 倍的解码速度提升,并在长文本生成基准中优于标准固定文本校准方法。研究还开发了针对稀疏矩阵-向量运算的优化内核,支持更高效的解码阶段计算。
来源:Hugging Face · 每日论文 · huggingface.co