​阿里云推出全球首个全模态 AI 模型 Qwen3-Omni

阿里云发布了 Qwen3-Omni,标志着全球首个原生端到端全模态 AI 模型的问世,并且该模型现已开源。Qwen3-Omni 具备处理文本、图像、音频和视频等多种输入类型的能力,能够实现实时流式输出,无论是通过文本还是自然语音,均能快速响应。

Qwen3-Omni 模型在多个领域展现出跨模态的先进表现。通过早期以文本为核心的预训练和混合多模态训练,该模型具备了强大的多模态能力。在音频和视频的性能上尤为出色,同时在文本和图像的效果上也能保持高标准。根据36项音频和视频的基准测试,Qwen3-Omni 在22项中达到了最新的领先水平,尤其是在自动语音识别和音频理解等领域的表现已与同行业的 Gemini2.5Pro 不相上下。

Qwen3-Omni 支持119种文本语言和19种语音输入语言,另外还有10种语音输出语言,包括英语、中文、法语和德语等多种语言。此项功能让它能够更好地服务于全球用户。其创新的架构设计基于 MoE(专家混合)系统,结合了 AuT 预训练,从而使模型具有强大的通用表征能力。同时,多码本设计确保了低延迟的实时音频和视频交互,支持自然对话的流畅进行。

除了 Qwen3-Omni,阿里云还发布了 Qwen3-TTS,一个支持17种音色选择的文本转语音模型。该模型在多项评估基准中表现出色,超越了多款竞品,尤其在语音稳定性和音色相似度方面尤为突出。

Qwen-Image-Edit-2509是另一个新发布的工具,专注于图像编辑的多图像支持,显著提升了编辑的一致性和效果。它不仅能够处理单图像,还支持多图像的拼接编辑,能够满足更复杂的编辑需求。

优秀的个人博客,低调大师

微信关注我们

原文链接:https://www.oschina.net/news/373838

转载内容版权归作者及来源网站所有!

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

相关文章

发表评论

资源下载

更多资源
优质分享Android(本站安卓app)

优质分享Android(本站安卓app)

近一个月的开发和优化,本站点的第一个app全新上线。该app采用极致压缩,本体才4.36MB。系统里面做了大量数据访问、缓存优化。方便用户在手机上查看文章。后续会推出HarmonyOS的适配版本。

Oracle Database,又名Oracle RDBMS

Oracle Database,又名Oracle RDBMS

Oracle Database,又名Oracle RDBMS,或简称Oracle。是甲骨文公司的一款关系数据库管理系统。它是在数据库领域一直处于领先地位的产品。可以说Oracle数据库系统是目前世界上流行的关系数据库管理系统,系统可移植性好、使用方便、功能强,适用于各类大、中、小、微机环境。它是一种高效率、可靠性好的、适应高吞吐量的数据库方案。

Java Development Kit(Java开发工具)

Java Development Kit(Java开发工具)

JDK是 Java 语言的软件开发工具包,主要用于移动设备、嵌入式设备上的java应用程序。JDK是整个java开发的核心,它包含了JAVA的运行环境(JVM+Java系统类库)和JAVA工具。

Sublime Text 一个代码编辑器

Sublime Text 一个代码编辑器

Sublime Text具有漂亮的用户界面和强大的功能,例如代码缩略图,Python的插件,代码段等。还可自定义键绑定,菜单和工具栏。Sublime Text 的主要功能包括:拼写检查,书签,完整的 Python API , Goto 功能,即时项目切换,多选择,多窗口等等。Sublime Text 是一个跨平台的编辑器,同时支持Windows、Linux、Mac OS X等操作系统。