阿里云通义千问发布全新端到端多模态模型Qwen2.5-Omni,性能卓越

阿里云最新发布Qwen2.5-Omni模型,支持多模态感知,实现文本、图像、音频和视频的实时交互,性能在多模态任务中达到业界领先水平。

11效率工具阿里云多模态模型Qwen2.5-Omni性能卓越

阿里云发布全新端到端多模态模型Qwen2.5-Omni

3月27日,阿里云发布新一代端到端多模态旗舰模型Qwen2.5-Omni,并在多个平台开源。

Qwen2.5-Omni采用Thinker-Talker双核架构,Thinker模块负责处理多模态输入,Talker模块负责语音合成输出。

阿里云通义千问发布新一代端到端多模态旗舰模型 Qwen2.5-Omni 并开源插图

该模型在多模态任务中表现出色,包括图像、音频、音视频等,性能优于同类单模态模型。

模型特点

  • 全能创新架构:支持文本、图像、音频、视频的跨模态理解。
  • 实时音视频交互:支持分块输入和即时输出。
  • 自然流畅的语音生成:语音生成的自然性和稳定性方面超越现有方案。
  • 全模态性能优势:在同等规模的单模态模型中表现卓越。
  • 卓越的端到端语音指令跟随能力:在MMLU通用知识理解和GSM8K数学推理等基准测试中表现优异。

性能表现

Qwen2.5-Omni在多模态任务OmniBench中达到SOTA表现,在单模态任务中表现优异,包括语音识别、翻译、音频理解、图像推理、视频理解和语音生成等。