或者,先转发到社区
发到你自己的账号下,原文只显示前面几行,大家能一起讨论
一句话说清:微软新出三款语音模型,让语音助手听得快、说得真、还便宜。
微软在 10 月 2 日发布了三款语音相关模型:MAI-Transcribe-2-Streaming(实时语音转文字)、MAI-Voice-2.1(多语种语音合成)、MAI-Voice-2.1-Flash(高速低价的语音合成)。简单说,一套负责"听",两套负责"说"。其中实时转录模型在权威榜单上准确率排第一,收到声音后约 100 毫秒就开始出字幕。
以后你用的语音助手、智能客服、实时字幕会更跟手:它能在你话没说完时就边听边出字幕;说话的声音也能保持同一个"人"的腔调,在不同语言间自由切换。对做小生意、做教程、做无障碍辅助的人来说很实用。
普通用户暂时不用自己去调这些模型。如果你用的 App(比如客服、翻译、配音工具)标注"由 Microsoft MAI 提供支持",体验会比以前更自然。想尝鲜可以等国内平台接入后再试,不用着急。
这些模型支持"声音克隆"(几秒录音就能仿出某人声音),微软说加了防滥用护栏,但技术本身也能被坏人拿去诈骗。接到"熟人"语音借钱,一定电话或视频核实,别光听声音就信。