主要来源IT之家
查看原文事件专题 · 多源确认
微软发布MAI-Image-2.5-Pro与MAI-Voice-2-Flash模型,已落地Bing和PowerPoint
微软7月23日推出两款自研模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash,进入公开预览。MAI-Image-2.5-Pro是微软精度最高的图像模型,文本输入每百万tokens 5美元,图像输出每百万tokens 106美元。MAI-Voice-2-Flash速度比MAI-Voice-2提升2倍,成本降低32%,定价每百万字符15美元。两款模型已用于Bing Image Creator、PowerPoint和OneDrive,其中MAI-Image-2.5相比GPT-Image-2降低GPU成本84%。MAI-Voice-2-Flash已接入Dynamics 365 Contact Center,可降低GPU成本89%。
当前结论
微软自己训练的新图像和语音模型,不用别人蒸馏,已经在Bing和PPT里用了,GPU成本降了八成多,价格也公开了。
3 个信源82° AI 热度最后更新 2026/7/24 00:00:53
证据链
相关来源 1OpenRouter
查看原文相关来源 2Mustafa Suleyman
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。