Optica因果视频模型
2 steps1 pieces2 Sources
【背景】因果视频扩散模型虽适合流媒体生成,但传统上需依赖双向教师模型蒸馏以弥补质量差距。2026年10月8日,Bowen Zheng等人在arXiv发布预印本,提出“条件残差预测”(CRP)训练方法,并推出20亿参数的因果视频模型Optica。该模型无需任何双向教师或复杂蒸馏管线,仅从图像模型初始化,在VBench基准测试中得分82.78,接近同规模双向模型性能。CRP的核心在于降低模型对历史帧的过度依赖:模型先基于当前输入进行无历史预测,历史信息仅作为残差补充。这一机制有效抑制了推理过程中因自身生成错误导致的误差传播。相比现有依赖双向教师的方法,Optica展示了更简单、可扩展的训练路径,为长视频和交互式生成提供了新的技术范式。
How it got here
论文《Conditional Residual Prediction: Improving Autoregressive Video Diffusion without a Bidirectional Teacher》提交至arXiv,作者包括Bowen Zheng、Zhiguang Liu等。
arxiv.org ↗研究团队提出CRP方法,训练出2B参数因果视频模型Optica,实现5秒480p视频自回归生成,VBench得分82.78。
arxiv.org ↗
What is still unsettled
- Optica模型是否已开源代码或权重?
- CRP方法在更长时长(如超过5秒)的视频生成中的稳定性如何?
- 该方法与现有的其他免教师蒸馏方案(如Self-Resampling)相比,计算效率具体提升多少?