小米发布端到端语音大模型Xiaomi-MiMo-Audio,实现自然对话与交互适配

小米公司近日开源了其首个端到端语音大模型Xiaomi-MiMo-Audio,该模型在自然度、情感表达和交互适配方面达到了拟人化水平,基于创新预训练架构和上亿小时训练数据,支持音频重建和音频转文本任务。

8效率工具语音大模型小米自然对话交互适配

小米开源首个原生端到端语音大模型Xiaomi-MiMo-Audio

小米公司于9月19日宣布开源其首个原生端到端语音大模型Xiaomi-MiMo-Audio,这是语音领域的一项重要突破。

小米开源首个原生端到端语音大模型 Xiaomi-MiMo-Audio,对话自然度、交互适配达拟人化水准插图

该模型基于创新预训练架构和上亿小时训练数据,实现了在智商、情商、表现力与安全性等方面的跨模态对齐能力提升,特别是在自然度、情感表达和交互适配方面达到了拟人化水准。

具体创新点包括:首次证明语音无损压缩预训练可以“涌现”出跨任务的泛化性,表现为Few-Shot Learning能力;明确语音生成式预训练的目标和定义,并开源了一套完整的语音预训练方案。

小米开源首个原生端到端语音大模型 Xiaomi-MiMo-Audio,对话自然度、交互适配达拟人化水准插图1

目前,Xiaomi-MiMo-Audio的预训练和指令微调模型已在Huggingface平台开源,Tokenizer模型则可在Github平台获取,其参数量达1.2B,基于Transformer架构。

下载与获取