跳到正文
热点事件持续更新

研究提出50M-token长上下文记忆方案,提升推理效率

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

研究人员提出名为galahad-kv的记忆层方案,通过将大语言模型推理中的中间状态(KV缓存)存储至本地NVMe磁盘,实现了在单张H100 GPU上处理5000万token长文本流。相比完全重新计算,该方案将加载速度提升了2.8至4.3倍,GPU能耗降低了8.8至12.3倍,并保持了稳定的内存占用。 该方案将每约16000个token的KV状态加密后存储,写入内存为一次性成本,但存储需要TB级的本地NVMe磁盘空间。研究团队称其测试协议旨在抵御常见的长上下文基准测试作弊方法,并提供了使用公开软件和免费许可包的单GPU复现方案。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. Hacker News · AI
    论文提出 50M-token 长上下文记忆方案,基于 KV 状态存储提升推理效率

    研究提出 galahad-kv 记忆层,将每 16,000 token 块的 KV 状态加密存储至本地 NVMe 磁盘,避免重算。在单个 NVIDIA H100 上,使用 vLLM 和 Gemma 4 12B/31B 模型处理 5000 万 token 文本流,加载速度比重算快 2.8x–4.3x,GPU 能耗降低 8.8x–12.3x,内存占用稳定。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。