资讯1 分钟阅读·
讯飞发布语音识别大模型,口语转写可直接成文
讯飞基于全国产算力发布Spark-ASR-2.0,主打上下文纠错与口语成文,效果数据为厂商口径,可关注落地表现。
重要性局部证据E3 可检验写法快讯
科大讯飞9月23日发布语音识别大模型Spark-ASR-2.0,训练全程使用全国产算力,已上线讯飞输入法并开放API。
新模型在非自回归快速转写之上,用投机解码结合大语言模型理解做二次纠错,官方称能修正同音字、删去口头语和改口,把口语整理成可直接使用的文本,整体推理成本较上一代Spark-ASR-1.0仅增加10%。
智东西实测显示,模型在方言、地铁噪音、悄悄话和中英文术语混合场景下转写稳定,但样例为自选场景。官方称多数场景词错误率低于业界最优水平,这一对比缺乏公开基准细节,实际提升幅度有待更多使用验证。