资讯1 分钟阅读·
因果Mamba实时降噪达3.32 PESQ
RT-SEMamba在25毫秒延迟下自报3.32 PESQ,蒸馏1层学生较教师提速2.64倍。
重要性局部证据E2 未复现
在25毫秒算法延迟约束下,实时语音增强可以做到3.32 PESQ——这是Rong Chao等人自报的RT-SEMamba在Voicebank-DEMAND上的结果,模型基于因果时频Mamba块。
此前实时降噪要在延迟和音质之间取舍,8层教师模型虽好但算力重。作者用渐进知识蒸馏把8层教师压到1层学生,PESQ由朴素1层基线的3.06升至3.18,稳态RTF不变,较教师提速2.64倍。作者称固定大小循环状态使长时推理更省内存与带宽。
以上均为作者自报的基准结果,尚未见第三方复现。预印本首版8月12日提交,9月16日修订至v2,arXiv页面标注获INTERSPEECH 2026接收(arXiv:2608.12099)。