跳到正文
Hugging Face · 每日论文·· 2 天前精选AI 评分70

论文提出5000万token长记忆方案:通过加密存储KV状态实现更快更省电的推理

Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute

AI 导读

研究测试了galahad-kv内存层,在单个NVIDIA H100上通过vLLM运行Gemma 4 12B和31B模型,处理5000万token真实文本。每块约16000token的KV状态被加密存储至本地NVMe盘,后续加载无需重计算,100次测试全部成功。

推荐理由

该研究验证了在真实5000万token上下文下,通过加密存储KV状态实现长记忆的可行性,且加载速度和能耗优于重计算,为长上下文推理提供了可复现的工程路径。

来源:Hugging Face · 每日论文 · huggingface.co