マイクロソフトは7月23日に、自社開発のAIモデル「MAI-Image-2.5-Pro」と「MAI-Voice-2-Flash」の2つのモデルをリリースすることを発表しました。これらのモデルは公開プレビュー段階に入っています。それぞれが高品質な画像生成と高并发の音声インタラクションシーンに特化しており、マイクロソフトは訓練データがクリーンアップされ、トレーサブルであることを強調しています。サードパーティのモデル蒸留に依存せず、設計段階からマイクロソフト製品ユーザーに直接サービスを提供するように構築されています。

画像モデルの精度が最高で、GPUコストが最大84%削減
MAI-Image-2.5-Proは、マイクロソフトが現在最も精度が高い画像モデルであり、主なビジュアル画像生成、詳細編集および画像内のテキストレンダリングなどの高要求なシナリオに適しています。自然言語による編集コマンドをサポートしています。このモデルはBing Image Creatorでデフォルトの画像生成モデルとなり、PowerPointでは画像から画像への編集機能に使用され、GPT-Image-2と比較してGPUコストを最大84%低くすることができます。OneDriveに導入した後、関連するシナリオでの保存成功率が26%向上し、P95遅延が約25%低下し、中程度の負荷を持つ生産環境での効率が2.5倍になりました。
価格面では、テキスト入力は100万トークンあたり5ドル、画像出力は100万トークンあたり106ドルです。
音声モデルの速度が2倍に向上し、T-Mobileなど顧客にもサービスを提供

MAI-Voice-2-Flashは頻繁な音声アプリケーション向けに最適化されており、前世代モデルと比べて速度が約2倍になり、コストは32%低下します。これはカスタマーセンターと音声アシスタントなどの迅速な応答が必要なシナリオに適しています。このモデルはDynamics 365 Contact Centerに統合され、T-MobileやEasyJetなどの顧客にサービスを提供しており、GPUコストは最大89%削減されます。マイクロソフトはさらにAzure Voice Liveサービスに統合し、開発者が音声から音声へのインタラクティブなエージェントを構築できるようにしています。
また、同シリーズのMAI-Transcribe-1.5は医療音声ソリューション「Dragon Copilot」に応用されており、17万人の医療従事者が利用しており、昨季度には2,800万件の患者問診記録を処理し、58言語をサポートしており、多くの言語の転写誤り率が50%減少しています。マイクロソフトは次世代GB200コンピューティングクラスターが運用を開始したことを明らかにし、MAIシリーズモデルは今後も拡張していく予定です。
