阿里云发布Qwen3-Omni:全模态AI模型开源,支持文本、图像、音视频处理

阿里云近日开源了Qwen3-Omni、Qwen3-TTS等AI工具,其中Qwen3-Omni是全球首个端到端全模态AI模型,支持文本、图像、音频和视频处理。

29效率工具AI工具全模态AI文本处理图像编辑

全新AI工具发布:Qwen3-Omni与Qwen3-TTS开源

阿里云于9月23日发布了全新的Qwen3-Omni、Qwen3-TTS,以及对标谷歌Nano Banana的Qwen-Image-Edit-2509图像编辑工具。

阿里通义深夜炸场:全球首个端到端全模态 AI 模型 Qwen3-Omni 发布开源,文本、图像、音视频全统一插图

Qwen3-Omni作为业界首个原生端到端全模态AI模型,能够处理多种类型的输入,并通过文本与自然语音实时流式输出结果。

阿里通义深夜炸场:全球首个端到端全模态 AI 模型 Qwen3-Omni 发布开源,文本、图像、音视频全统一插图1

Qwen3-Omni核心特性

  • 跨模态最先进表现:通过预训练和混合多模态训练,模型具备原生多模态能力,在音频、音视频性能上表现优异。
  • 多语言支持:支持119种文本语言、19种语音输入语言以及10种语音输出语言。
  • 创新架构:基于MoE的“思考者–表达者”设计,结合AuT预训练,采用多码本设计以降低延迟。
  • 实时音频/视频交互:低延迟流式交互,支持自然轮流对话和即时文本或语音响应。
  • 灵活控制:可通过系统提示词自定义行为,实现细粒度控制与轻松适配。

TTS支持17种音色选择

TTS即文本转语音,阿里云此次发布的TTS支持17种音色选择,每一种音色均支持10种语言,包括多国语言和中国方言。

阿里通义深夜炸场:全球首个端到端全模态 AI 模型 Qwen3-Omni 发布开源,文本、图像、音视频全统一插图2

Qwen-Image-Edit-2509升级

Qwen-Image-Edit-2509是Qwen-Image的月度迭代升级版本,主要改进包括多图像编辑支持、增强的单图像一致性以及原生支持ControlNet等。