资讯1 分钟阅读·
XTurnix统一对话轮次控制
新模型用550万样本实现听/说状态统一判断,自建基准准确率达89%。
重要性局部证据E2 未复现写法快讯
XTurnix模型将对话轮次控制简化为两个二元决策,在作者自建基准上达到89.06%准确率。
传统语音AI需分别处理“何时开始说话”和“何时停止”,导致系统复杂且易出错。XTurnix利用550万个从带时间戳的双人对话中自动提取的因果动作示例进行预训练,使单一文本模型能根据当前是“听”还是“说”的状态,预测统一的控制令牌。
在四个公共基准测试中,XTurnix在SemanticVAD和LiveKit上取得最佳成绩,并在Easy-Turn的不完整轮次识别上表现最高。但在作者自建的平衡基准上,其准确率比最强第三方基线高出超过20个百分点。
该结果出自10月3日提交的预印本,代码已开源,但高性能数据主要依赖未公开细节的自建测试集,尚待社区独立复现。