微软宣布推出两款自研 AI 模型 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,均已进入公开预览阶段。

其中:
- MAI-Image-2.5-Pro 适用于对质量要求极高的应用场景。包括精美的图片、精细的编辑以及精准的图像内文字渲染。Pro 是我们迄今为止保真度最高的图像模型,定价为每百万个文本输入 token 5 美元,每百万个图像输入 token 8 美元,每百万个图像输出 token 106 美元。
- MAI-Voice-2-Flash 首次亮相于 Build 大会,专为速度和规模化而打造。对于响应速度至关重要的大规模语音体验而言,Flash 是快速高效的理想之选,同时还能保留 MAI-Voice-2 的自然韵律和高品质音效。Flash 的速度是 MAI-Voice-2 的两倍,价格却便宜 32%,每百万字符仅需 15 美元。
“MAI-Image-2.5-Pro 标志着 GenMedia 工具系列的一次重大飞跃。除了令人惊叹的图像质量外,它能够以如此高的精度渲染文本,这确实是一项重大突破。它还能理解自然语言编辑指令,因此创意迭代过程变得更快、也更加直观。微软已稳稳跻身生成式人工智能领域的领导者之列。”

目前,MAI-Image-2.5 已在 Bing Image Creator 中成为默认图像生成模型;并在 PowerPoint 中用于图像到图像编辑功能,与 GPT-Image-2 相比,GPU 成本最多可降低 84%。在OneDrive中部署后,相关场景保存成功率提升26%,P95 延迟降低约25%,中等负载生产环境效率提升2. 5 倍。
同时,MAI-Image-2.5 也已成为 OneDrive 关键生产环境图像编辑场景的默认模型。自推出以来,其保存率提高了 26%,P95 延迟降低了约 25%,并且在中等负载的生产工作负载下效率提高了 2.5 倍。
MAI-Voice-2-Flash 则已接入 Dynamics 365 Contact Center,为 T-Mobile、EasyJet 等客户提供服务,GPU 成本最高降低 89%。以及集成至 Azure Voice Live,支持开发者构建语音到语音交互智能体。
此外,同系列的 MAI-Transcribe-1. 5 已应用于医疗语音解决方案 Dragon Copilot,支持 58 种语言,多数语言转录错误率相对下降50%。微软透露下一代 GB200 计算集群已投入运行,MAI 系列模型将持续扩展。