预印本称自蒸馏训练可挽回极端视觉压缩的损失
作者自测显示5%视觉token下性能从68.6%升至82.3%,方向可关注,效果待独立复现。
预印本LT-OPD提出一种自蒸馏训练法:压缩后的多模态模型用自己生成的轨迹学习,由同一模型的完整视觉token版本当老师,并逐步降低训练中的token预算。
作者在Qwen3.5-4B上自测,9个基准的平均保留性能在5%视觉token下从68.6%升到82.3%,同时KV缓存用量降85.2%、预填充计算量降85.4%。论文称该方法在Qwen3.5-9B、GLM-4.6V-9B和LLaVA-OV-1.5-4B上也有一致提升。
论文9月26日提交arXiv,全部结果为作者自测,基准由作者自选,效果待独立复现。