单作者预印本自报:Fathom按查询自适应读取K缓存位数,百万token解码步较136位稀疏扫描快1.67倍
单作者自测、计时用合成KV,1.67倍先当线索,等独立复现再作结论。
原始事件 2026-09-15
资料核对时间:2026/09/18 14:38
这是一篇历史文章。正文中的预测、价格和后续节点均属于当时的时间范围。
单作者arXiv预印本(9月15日提交,17日更新v2)自报、未经独立验证:KV缓存与索引驻留主机内存的百万token场景下,Fathom让每个查询自适应决定读取4位K缓存的位数。作者称Qwen3-8B百万token解码步GPU耗时较136位稀疏扫描快1.67倍,计时用合成KV;真实编程代理会话92位即匹配最准扫描的步一致性。索引在GPU内存时无加速。
资料来源:arXiv预印本 ↗、作者代码仓库 ↗