摘要:
微软推出三款面向实时语音交互的新模型,分别是语音转文字模型MAI-Transcribe-2-Streaming,以及文本转语音模型MAI-Voice-2.1和MAI-Voice-2.1-Flash。微软希望开发者将它们组合起来,构建能够边听边处理、再以自然语音即时回应的语音助手和对话代理。

MAI-Transcribe-2-Streaming与此前只能处理录音文件的MAI-Transcribe-2不同,可接收持续输入的音频流,并在说话者尚未讲完时就开始生成阶段性文本,再随着更多语境到来持续修订,最后提交稳定结果。微软称,该模型支持60种语言并能连续自动识别语言;首批识别假设在收到音频后略多于100毫秒即可出现,适用于语音代理、客服、会议和课堂字幕、语音输入等场景。微软内部对听写和字幕的测试显示,文字出现速度约为最接近竞争产品的两倍,这一比较来自公司自己的评测。
Artificial Analysis的流式转录基准将该模型列为最终文本和阶段性文本准确率第一。其公布的测试成绩为最终转录词错误率约2.5%,在检测到说话结束后约0.13秒给出最终文本;该榜单当时比较了38款模型,测试约8小时音频,涵盖AA-AgentTalk、VoxPopuli和Earnings22三类语料,分别占综合权重的50%、25%和25%。词错误率越低越好。该结果说明模型在这套基准中的表现,不代表所有语言、噪声环境和实际应用都能达到相同准确率。
MAI-Transcribe-2-Streaming目前的促销价为每小时音频0.54美元,优惠持续至2026年底;相比之下,非流式MAI-Transcribe-2此前宣传的价格为每小时0.10美元。实时版更适合连续交互,批处理版则面向录制音频转写,两者价格不能简单视为同一使用方式下的直接对比。
新款语音合成模型MAI-Voice-2.1支持23种语言、26个地区变体,可让同一个合成声音在不同语言间切换,同时尽量保留说话者身份并采用相应语言的本地口音,定价为每100万字符22美元。面向低延迟和大规模请求的MAI-Voice-2.1-Flash支持相同语言,微软称其可在端到端延迟约150毫秒的情况下生成45秒音频,模型推理速度提高55%,价格比可比模型低约60%,定价为每100万字符15美元。后一组速度和价格优势属于微软公布的比较结果。
两款语音模型均支持跨语言的即时语音克隆,但需使用获授权并获得本人同意的参考声音。微软文档将该功能列为受限访问,参考音频建议为5至60秒,并设有防止滥用的保护措施。MAI-Voice-2.1适合较长内容、旁白和有声读物,Flash则偏向语音代理、助手和客服等实时场景。
三款模型均可通过Microsoft Foundry、MAI Playground和Vercel使用;两款Voice模型也已接入OpenRouter,并可通过Azure Voice Live调用,LiveKit支持则预计稍后推出。微软Azure文档目前将这些模型标为公开预览版,说明尚无服务级别协议,也不建议直接用于生产工作负载。
了解更多:
https://microsoft.ai/news/our-first-streaming-transcription-model/
评论