资讯1 分钟阅读·
SyncVoice自报零样本视频配音SOTA,单一模型统一中英配音
厦门大学与小米MiLM Plus等团队自报:SyncVoice在预训练TTS上接入文本-视觉融合模块,实现口型同步的零样本中英视频配音。
重要性局部证据E2 未复现
一个名为SyncVoice的模型可以让合成语音与画面中的口型等线索时间同步,并据作者称在LRS3数据集零样本配音上达到SOTA,用约600小时中文、1190小时英文视听数据训练出中英统一模型。
此前预训练TTS只按文本生成语音,不感知画面线索,配音与口型难以对齐,中英配音通常还需分别处理。
以上为厦门大学与小米MiLM Plus等团队作者自报结果,尚无独立验证。
边界:结果未经第三方复现;该工作为arXiv预印本(id 2512.05126),2025年11月23日首次提交,2026年9月15日修订为v2。