游乐游手机版
首页/AI热点日报/热点详情

微软发布未蒸馏MAI-Image与MAI-Voice模型,落地Bing和PowerPoint

类型:热点整理2026-07-24
微软公司近日发布MAI-Image-2 5-Pro和MAI-Voice-2-Flash两款完全自研模型,不依赖第三方蒸馏技术,已成功落地Bing、PowerPoint、Dynamics365等多个产品场景,在图像生成与语音交互方面实现了性能大幅提升并显著降低成本,同时已接入Azure云平台及医疗语音服务系统。

本周早些时候,微软正式端出了两款自研AI模型的新面孔——MAI-Image-2.5-Pro和MAI-Voice-2-Flash,目前已经进入公开预览阶段。这两款模型分别瞄准了高质量图像生成和高并发语音交互两个方向,属于微软AI团队自研模型系列的最新成员。

微软最新模型 MAI-Image-2.5-Pro、MAI-Voice-2-Flash 发布:未蒸馏第三方产品,已落地 Bing 及 PowerPoint 等场景

微软在发布时透露,过去一年里,公司一直在走一条“自研”路线——用经过清理、可追溯、企业级的数据进行训练,不依赖第三方模型蒸馏,从底层设计上就瞄准了微软自家产品用户的需求。这套逻辑,说白了就是:模型从一开始就是为服务微软生态而生的。

先来看MAI-Image-2.5-Pro。这是微软目前精度最高的图像模型,主要面向对图像质量要求比较高的场景,比如主视觉图片生成、细节编辑,以及图像内文字渲染。微软特别强调,这款模型在图像中文字生成的准确性上做了专项优化,并且支持自然语言编辑指令——你只需要用文字描述想调整的内容,模型就能直接生成对应的修改结果。

价格方面,MAI-Image-2.5-Pro的公开预览定价如下:文本输入每100万个Token收费5美元(约合33.9元软妹币),图像输入每100万个Token收费8美元(约合54.3元软妹币),图像输出则是每100万个Token收费106美元(约合718.8元软妹币)。这个价格体系,基本可以看作是对标高端图像生成服务的定价策略。

另一款模型MAI-Voice-2-Flash,则针对高频语音应用做了优化。相比MAI-Voice-2,速度提升了大约一倍,成本却降低了近三分之一。用微软的话说,在保持自然语调和较高语音质量的前提下,能够为大规模语音服务提供更低的延迟支持。这款模型的公开预览价格是每100万个字符15美元(约合101.7元软妹币)。从应用场景来看,客服中心、语音助手这类需要快速响应的场景,是它的主战场。

那么,这两款模型到底落地到了哪些产品里?微软的部署思路其实挺清晰的。

在Bing Image Creator中,MAI-Image-2.5已经成为默认的图像生成模型,直接为用户提供图像生成和编辑能力。PowerPoint这边,MAI-Image-2.5被用于图像到图像编辑功能,微软给出的数据是:相比GPT-Image-2,GPU成本最高可降低84%。OneDrive也不甘落后,MAI-Image-2.5已经成为部分图像编辑功能的默认模型,部署后相关场景的保存成功率提升了26%,P95延迟降低约25%,在中等负载生产环境中的效率提升了2.5倍。

语音方面,MAI-Voice-2-Flash已经接入Dynamics 365 Contact Center,用于企业客服智能体服务。微软表示,这款模型最高可降低89%的GPU成本,并且已经在T-Mobile、EasyJet等客户的场景中落地。此外,MAI-Voice-2-Flash还被集成到了Azure Voice Live服务中,开发者可以利用它构建支持语音到语音交互的智能体。

在医疗领域,微软的自研模型也找到了用武之地。MAI-Transcribe-1.5被应用于医疗语音解决方案Dragon Copilot,目前这个服务被17万名医疗服务提供者使用,上季度处理了2800万次患者问诊记录。MAI-Transcribe-1.5支持58种语言,在内部多语言录音测试中,大多数语言的语音转录错误率和语言识别错误率都实现了50%的相对下降。早期研究还显示,它生成的医疗记录准确性也有所提升。

最后,微软透露了一个信号:MAI系列模型将继续扩展,并通过Foundry平台提供给开发者使用。与此同时,微软AI团队的下一代GB200计算集群已经投入运行,后续模型研发已经在路上。这让人不得不感叹,微软在AI自研这件事上,确实是在认真反赌。

来源:https://www.ithome.com/0/980/899.htm

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。