
微软发布MAI-Voice-1语音模型及MAI-1-preview通用模型,AI生成音频技术再升级
微软近日推出两款自研AI模型,MAI-Voice-1语音模型能在1秒内生成1分钟音频,MAI-1-preview通用模型则指向Copilot文本场景的未来发展。MAI-Voice-1已应用于多项功能,包括Copilot Daily新闻播报和播客对话生成。MAI-1-preview模型则适用于特定需求用户,可提供实用回应。
微软发布MAI-Voice-1语音模型及MAI-1-preview通用模型
微软人工智能部门正式推出MAI-Voice-1语音模型和MAI-1-preview通用模型。MAI-Voice-1仅需单块GPU,即可在1秒内生成时长1分钟的音频。MAI-1-preview模型则展示了Copilot未来文本场景的功能发展方向。
MAI-Voice-1已在Copilot Daily功能中用于新闻播报,并生成播客风格的对话内容。用户可在Copilot Labs平台体验MAI-Voice-1,自定义语音音色和说话风格。
MAI-1-preview模型训练使用了约1.5万块英伟达H100 GPU,专为特定需求用户设计,具备遵循指令的能力。

微软AI负责人穆斯塔法・苏莱曼表示,公司致力于打造对消费者体验极佳的产品,并在自身应用场景进行深度优化。
微软计划将MAI-1-preview模型应用于Copilot助手的特定文本使用场景,并已在AI基准测试平台LMArena上进行公开测试。