
微软推出自研实时语音模型MAI Realtime,支持全双工交互及多语言
微软最新推出的实时语音模型MAI Realtime,支持中文、英语等16种语言,具备全双工交互能力,实现对话中的“听说并行”。该模型已在MAI Playground平台上进行测试,提供更自然的语音体验,但目前仅限于对话系统使用。
微软自研实时语音模型MAI Realtime介绍
微软近期推出了一款自研的实时语音模型“MAI Realtime”,旨在为用户提供更加便捷和高效的语音交互体验。
该模型支持中文、英语等16种语言,并具备全双工交互能力,允许用户在对话中实现“听说并行”,无需等待对方回应即可继续对话。
目前,MAI Realtime已在MAI Playground平台上邀请部分合作伙伴进行测试。该模型突破了传统语音模型“用户说完、模型再答”的轮次交替限制,采用了双向全双工交互方式,支持同步聆听与回应,并能自动识别语言或中途切换。

在语音体验上,测试版提供了Victoria和Grant两种风格,据称比Copilot现有的语音模式更加自然。不过,需要注意的是,该模型目前定位为对话系统,不支持唱歌或生成非语音音效。
微软此前发布的MAI语音模型(如MAI-Voice-2)均为单向模型,此次MAI Realtime的推出标志着微软在实时交互领域的重要进展。