研究提出50M-token长上下文记忆方案,提升推理效率
热点事件持续更新
研究提出50M-token长上下文记忆方案,提升推理效率
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
研究人员提出名为galahad-kv的记忆层方案,通过将大语言模型推理中的中间状态(KV缓存)存储至本地NVMe磁盘,实现了在单张H100 GPU上处理5000万token长文本流。相比完全重新计算,该方案将加载速度提升了2.8至4.3倍,GPU能耗降低了8.8至12.3倍,并保持了稳定的内存占用。 该方案将每约16000个token的KV状态加密后存储,写入内存为一次性成本,但存储需要TB级的本地NVMe磁盘空间。研究团队称其测试协议旨在抵御常见的长上下文基准测试作弊方法,并提供了使用公开软件和免费许可包的单GPU复现方案。
AI 根据报道生成 · 2 小时前更新
最新进展10月9日 08:25
论文提出 50M-token 长上下文记忆方案,基于 KV 状态存储提升推理效率报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- Hacker News · AI论文提出 50M-token 长上下文记忆方案,基于 KV 状态存储提升推理效率
研究提出 galahad-kv 记忆层,将每 16,000 token 块的 KV 状态加密存储至本地 NVMe 磁盘,避免重算。在单个 NVIDIA H100 上,使用 vLLM 和 Gemma 4 12B/31B 模型处理 5000 万 token 文本流,加载速度比重算快 2.8x–4.3x,GPU 能耗降低 8.8x–12.3x,内存占用稳定。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。