本周早些时候,微软正式端出了两款自研AI模型的新面孔——MAI-Image-2.5-Pro和MAI-Voice-2-Flash,目前已经进入公开预览阶段。这两款模型分别瞄准了高质量图像生成和高并发语音交互两个方向,属于微软AI团队自研模型系列的最新成员。

微软在发布时透露,过去一年里,公司一直在走一条“自研”路线——用经过清理、可追溯、企业级的数据进行训练,不依赖第三方模型蒸馏,从底层设计上就瞄准了微软自家产品用户的需求。这套逻辑,说白了就是:模型从一开始就是为服务微软生态而生的。
先来看MAI-Image-2.5-Pro。这是微软目前精度最高的图像模型,主要面向对图像质量要求比较高的场景,比如主视觉图片生成、细节编辑,以及图像内文字渲染。微软特别强调,这款模型在图像中文字生成的准确性上做了专项优化,并且支持自然语言编辑指令——你只需要用文字描述想调整的内容,模型就能直接生成对应的修改结果。
价格方面,MAI-Image-2.5-Pro的公开预览定价如下:文本输入每100万个Token收费5美元(约合33.9元软妹币),图像输入每100万个Token收费8美元(约合54.3元软妹币),图像输出则是每100万个Token收费106美元(约合718.8元软妹币)。这个价格体系,基本可以看作是对标高端图像生成服务的定价策略。
另一款模型MAI-Voice-2-Flash,则针对高频语音应用做了优化。相比MAI-Voice-2,速度提升了大约一倍,成本却降低了近三分之一。用微软的话说,在保持自然语调和较高语音质量的前提下,能够为大规模语音服务提供更低的延迟支持。这款模型的公开预览价格是每100万个字符15美元(约合101.7元软妹币)。从应用场景来看,客服中心、语音助手这类需要快速响应的场景,是它的主战场。
那么,这两款模型到底落地到了哪些产品里?微软的部署思路其实挺清晰的。
在Bing Image Creator中,MAI-Image-2.5已经成为默认的图像生成模型,直接为用户提供图像生成和编辑能力。PowerPoint这边,MAI-Image-2.5被用于图像到图像编辑功能,微软给出的数据是:相比GPT-Image-2,GPU成本最高可降低84%。OneDrive也不甘落后,MAI-Image-2.5已经成为部分图像编辑功能的默认模型,部署后相关场景的保存成功率提升了26%,P95延迟降低约25%,在中等负载生产环境中的效率提升了2.5倍。
语音方面,MAI-Voice-2-Flash已经接入Dynamics 365 Contact Center,用于企业客服智能体服务。微软表示,这款模型最高可降低89%的GPU成本,并且已经在T-Mobile、EasyJet等客户的场景中落地。此外,MAI-Voice-2-Flash还被集成到了Azure Voice Live服务中,开发者可以利用它构建支持语音到语音交互的智能体。
在医疗领域,微软的自研模型也找到了用武之地。MAI-Transcribe-1.5被应用于医疗语音解决方案Dragon Copilot,目前这个服务被17万名医疗服务提供者使用,上季度处理了2800万次患者问诊记录。MAI-Transcribe-1.5支持58种语言,在内部多语言录音测试中,大多数语言的语音转录错误率和语言识别错误率都实现了50%的相对下降。早期研究还显示,它生成的医疗记录准确性也有所提升。
最后,微软透露了一个信号:MAI系列模型将继续扩展,并通过Foundry平台提供给开发者使用。与此同时,微软AI团队的下一代GB200计算集群已经投入运行,后续模型研发已经在路上。这让人不得不感叹,微软在AI自研这件事上,确实是在认真反赌。
