RAM-Net架构
3 단계1 건2 출처
【背景】传统线性注意力模型将无限历史压缩为固定大小状态,导致令牌间干扰和信息丢失。香港中文大学团队提出RAM-Net架构,通过“稀疏可寻址状态”解决这一瓶颈。
该架构于2026年2月12日首次提交arXiv,并于10月7日发布修订版v2,正式被NeurIPS 2026接收。其核心创新在于引入地址解码器,将输入映射为高维稀疏向量作为显式地址,使模型能选择性访问庞大内存状态中的独立槽位。这种设计实现了状态大小的指数级扩展而无需增加参数,显著抑制了信号干扰。
实验数据显示,RAM-Net在细粒度长距离检索任务中超越现有基线,且每步状态访问次数比Mamba2少8倍。尽管其在语言建模困惑度上表现具有竞争力,但部分第三方分析指出其在某些基准上仍落后于领先的delta-rule模型,显示其在通用推理与极致效率间的权衡尚存争议。
读者应关注:1. NeurIPS 2026会议期间的官方代码发布情况;2. 后续是否有关于更大规模参数模型的性能验证报告。
현재까지의 과정
RAM-Net论文v1版本提交至arXiv,标题为《Expressive Linear Attention with Selectively Addressable Memory》。
arxiv.org ↗论文v2版本发布,标题调整为《Linear-Time Sequence Modeling with Sparsely Addressable State》,并确认被NeurIPS 2026接收。
arxiv.org ↗新闻摘要报道RAM-Net通过独立槽位寻址减少令牌干扰,每步状态访问比Mamba2少8倍。
arxiv.org ↗
아직 해결되지 않은 문제
- RAM-Net在大规模工业级部署中的实际推理延迟与内存占用具体数值是多少?
- 相较于Delta-rule等最新线性注意力变体,RAM-Net在常识推理任务上的差距是否可通过进一步调优缩小?