跳到正文
Hacker News · AI· Corbenic·· 3 小时前AI 评分60

论文提出 50M-token 长上下文记忆方案,基于 KV 状态存储提升推理效率

Long-Term Memory for AI:50M-Token Window,Is Faster,Cheaper Than Recompute

AI 导读

研究提出 galahad-kv 记忆层,将每 16,000 token 块的 KV 状态加密存储至本地 NVMe 磁盘,避免重算。在单个 NVIDIA H100 上,使用 vLLM 和 Gemma 4 12B/31B 模型处理 5000 万 token 文本流,加载速度比重算快 2.8x–4.3x,GPU 能耗降低 8.8x–12.3x,内存占用稳定。

来源:Hacker News · AI · arxiv.org