微软发布首个流式语音转写模型,边听边转写瞄准语音智能体
微软补齐语音智能体的实时转写环节,但延迟与定价均为官方口径,实际效果待开发者验证。
微软于10月1日发布MAI家族首个流式语音转写模型MAI-Transcribe-2-Streaming,可在说话人尚未讲完时持续输出临时转写结果。
该模型通过WebSocket接收语音,官方称平均320毫秒返回首个转写结果,支持60多种语言并自动识别语种,定价为每音频小时54美分。微软同时说明,实际速度还取决于网络和生成回复的模型,并非所有场景都能保证这一延迟。
作为对比,微软上月发布的非流式版本MAI-Transcribe-2定价每音频小时10美分,需等说话人讲完才开始处理;流式版本贵五倍多,换来的是边听边转。同日发布的还有语音合成模型MAI-Voice-2.1及其精简版。这批模型与推理模型Mai-Thinking-1组合后,微软已具备搭建完整语音智能体的自研组件,与其减少对OpenAI和Anthropic付费依赖的路线一致。
信息源:https://microsoft.ai/news/our-first-streaming-transcription-model