在人工智能领域,大语言模型的长文本处理能力一直是研究热点。当模型进行长链条推理时,生成的文本可能包含数千甚至上万个token,为确保后续步骤能“回顾”前文内容,系统会存储中间计算结果,形成所谓的KV缓存。然而,随着文本长度增加,缓存占用显存过多的问题日益突出,如何优化KV缓存成为关键挑战。
传统解决方案聚焦于“KV缓存淘汰”机制:当缓存空间不足时,系统会丢弃部分旧token信息,仅保留固定数量的内容。现有方法普遍采用打分策略,根据token的“未来价值”评估其重要性,保留高分token、淘汰低分者。从早期的H2O到后续的SnapKV、R-KV等模型,研究焦点始终围绕如何设计更精准的打分公式。
要理解随机策略的有效性,需先剖析KV缓存的构成。研究将缓存内容分为两类:一是提示词,即用户输入的问题或系统设定,这类信息仅出现一次,若被删除将无法恢复;二是推理轨迹,即模型生成的思考过程,其特点是对同一信息反复提及,存在文本层面的冗余。例如,模型在解题时可能多次确认“目标为最大值”,即使部分内容被删除,其他位置的重复信息仍可提供线索。
实验进一步验证了提示词保护的关键作用。研究人员测试了SnapKV、R-KV等打分方法在“默认设置”与“强制保留提示词”两种模式下的表现。结果显示,SnapKV等依赖“近期关注度”打分的方法,默认模式下易忽略早期生成的提示词,导致准确率大幅下降;而强制保留提示词后,其在科学推理任务中的表现提升22.5个百分点。相比之下,R-KV等本身倾向保护提示词的方法,强制保留规则带来的提升仅1.9个百分点。这表明,打分方法间的差距主要源于提示词保护程度,而非算法本身的优劣。
推理轨迹的冗余特性为随机淘汰提供了理论支撑。研究指出,其冗余体现在两层面:一是文本重复,模型会多次复述已确定的信息;二是跨注意力头冗余,不同头可能独立保留同一信息的不同片段。例如,在数学推理中,模型可能多次提及“x=5”,即使部分头删除了这一信息,其他头仍可能保留。探针实验显示,在8个注意力头中,若仅1个头保留关键信息,模型答对率仅3%;但若有3个头保留,答对率跃升至83%。这表明模型通过整合多头线索还原信息,而非依赖单一头的完整记忆。
这项研究不仅挑战了KV缓存淘汰领域的传统认知,更揭示了研究中的“隐藏变量”:过去方法间的性能差异可能源于提示词保护程度的差异,而非打分算法本身的精妙。例如,此前将随机策略作为基准的测试中,其表现不佳的原因正是未区分提示词与推理轨迹,导致关键信息被误删。多头冗余实验暗示,大模型的信息处理方式可能更接近分布式系统,而非单一线性存储,这与人类记忆的“提示效应”存在相似之处——单个线索难以唤醒记忆,但多个线索的组合可显著提升回忆准确率。