
小米发布端到端语音大模型Xiaomi-MiMo-Audio,实现自然对话与交互适配
小米公司近日开源了其首个端到端语音大模型Xiaomi-MiMo-Audio,该模型在自然度、情感表达和交互适配方面达到了拟人化水平,基于创新预训练架构和上亿小时训练数据,支持音频重建和音频转文本任务。
小米开源首个原生端到端语音大模型Xiaomi-MiMo-Audio
小米公司于9月19日宣布开源其首个原生端到端语音大模型Xiaomi-MiMo-Audio,这是语音领域的一项重要突破。

该模型基于创新预训练架构和上亿小时训练数据,实现了在智商、情商、表现力与安全性等方面的跨模态对齐能力提升,特别是在自然度、情感表达和交互适配方面达到了拟人化水准。
具体创新点包括:首次证明语音无损压缩预训练可以“涌现”出跨任务的泛化性,表现为Few-Shot Learning能力;明确语音生成式预训练的目标和定义,并开源了一套完整的语音预训练方案。

目前,Xiaomi-MiMo-Audio的预训练和指令微调模型已在Huggingface平台开源,Tokenizer模型则可在Github平台获取,其参数量达1.2B,基于Transformer架构。