8月4日消息,据科技媒体TestingCatalog 8月2日报道,微软正在测试其首款原生实时语音模型“MAI Realtime”。该模型支持中文、英语等16种语言,并具备全双工交互能力,可在对话中实现“听说并行”。
目前,微软已邀请部分合作伙伴在MAI Playground平台上进行测试。技术层面,MAI Realtime突破了传统语音模型“用户说完、模型再答”的轮次交替限制,采用了双向全双工交互方式,支持同步聆听与回应,并能自动识别语言或中途切换。
在语音体验上,测试版提供了Victoria和Grant两种风格,据称比Copilot现有的语音模式更加自然。不过,该模型目前定位为对话系统,不支持唱歌或生成非语音音效。微软此前发布的MAI语音模型(如MAI-Voice-2)均为单向模型,此次MAI Realtime的推出标志着其在实时交互领域的重要进展。


微信扫一扫
支付宝扫一扫 