
阿里云发布Qwen3-Omni:全模态AI模型开源,支持文本、图像、音视频处理
阿里云近日开源了Qwen3-Omni、Qwen3-TTS等AI工具,其中Qwen3-Omni是全球首个端到端全模态AI模型,支持文本、图像、音频和视频处理。
全新AI工具发布:Qwen3-Omni与Qwen3-TTS开源
阿里云于9月23日发布了全新的Qwen3-Omni、Qwen3-TTS,以及对标谷歌Nano Banana的Qwen-Image-Edit-2509图像编辑工具。

Qwen3-Omni作为业界首个原生端到端全模态AI模型,能够处理多种类型的输入,并通过文本与自然语音实时流式输出结果。

Qwen3-Omni核心特性
- 跨模态最先进表现:通过预训练和混合多模态训练,模型具备原生多模态能力,在音频、音视频性能上表现优异。
- 多语言支持:支持119种文本语言、19种语音输入语言以及10种语音输出语言。
- 创新架构:基于MoE的“思考者–表达者”设计,结合AuT预训练,采用多码本设计以降低延迟。
- 实时音频/视频交互:低延迟流式交互,支持自然轮流对话和即时文本或语音响应。
- 灵活控制:可通过系统提示词自定义行为,实现细粒度控制与轻松适配。
TTS支持17种音色选择
TTS即文本转语音,阿里云此次发布的TTS支持17种音色选择,每一种音色均支持10种语言,包括多国语言和中国方言。

Qwen-Image-Edit-2509升级
Qwen-Image-Edit-2509是Qwen-Image的月度迭代升级版本,主要改进包括多图像编辑支持、增强的单图像一致性以及原生支持ControlNet等。