资讯1 分钟阅读·
滑窗注意力优于线性注意力
预印本显示,无需重训的滑窗注意力在长文本任务中性能比线性注意力高2至10倍。
重要性实质性证据E2 未复现写法快讯
滑窗注意力(SWA)配合注意力汇聚点,在长上下文推理任务中的表现优于大多数改造后的线性注意力模型。
该研究对比了两种降低大语言模型内存消耗的方法:压缩KV缓存(如SWA)和将模型改造为使用固定大小状态的线性注意力。结果显示,在Needle-in-a-Haystack和BABILong等长文本基准测试中,SWA的性能是线性注意力的2到10倍。
SWA不需要额外的训练,运行速度快且内存占用低。作者指出,当训练预算有限时,切换到SWA是比改造线性注意力更有效的降低推理成本的方式。
此为arXiv预印本(v2版于2026年10月4日更新),结论尚未经过独立复现验证。