预印本:条件残差预测助因果视频模型VBench得82.78分,无需双向教师蒸馏
新训练方法使20亿参数因果视频模型在VBench得82.78分,接近双向模型性能。
重要性实质性证据E2 未复现写法快讯
重点:一种名为“条件残差预测”(CRP)的新训练方法,使20亿参数的因果视频扩散模型Optica在VBench基准测试中获得82.78分,仅使用约1500万训练视频。
背景:传统因果视频模型因自回归生成特性适合流媒体和长视频,但质量通常低于同规模的双向模型。现有方案多依赖从大型双向教师模型进行知识蒸馏,流程复杂且计算成本高。
结论:CRP通过让模型先预测目标再叠加历史条件的残差,减少了模型对历史信息的过度依赖。实验显示,该方法几乎消除了与同设置下双向模型的6.14分差距,且无需任何双向视频模型参与训练阶段。
边界:结果来自作者自测的预印本论文,尚未见独立复现;主要验证于480p、5秒时长的视频生成任务。