清华团队提出模型缓存直连法,称多模型协作提速一倍以上
多模型协作可绕过文字直接交换缓存,但提速数字出自作者自测,且仅限开放权重模型,待第三方复测。
原始事件 2026-09-25
清华团队提出的Cache-to-Cache(C2C)方法被ICLR 2026接收,代码已开源:两个模型不再生成文字,而是直接交换各自的内部缓存。
一个叫Fuser的小模块负责转换两套互不兼容的缓存格式,再用门控决定哪些层吸收信息。作者自测协作任务提速100%至150%,对比文字通信准确率高3.1%至5.4%。
方法只适用于开放权重的模型,闭源聊天模型拿不到内部缓存,用不上这条捷径;全部测试由提出方法的团队自己完成,实际效果待第三方复测。