マイクロソフトは9月3日に新世代の音声認識モデル「MAI-Transcribe-2」を正式にリリースしました。これまでで最も機能が強く、効率的な転写製品として、このモデルはFLEURSベンチマークテスト(60言語をカバー)において平均単語誤り率(WER)5.2%を達成し、Artificial Analysisの単語誤り率ランキングで第2位となりました。

高い精度を維持しながらも、長時間の音声処理速度は競合企業を10倍上回り、1時間分の音声を約10秒で処理できます。現在、このモデルはMicrosoft Foundry、MAI PlaygroundおよびOpen Routerで利用可能となっており、限定価格で提供されており、1時間分の音声につき0.10ドルです。
MAI-Transcribe-2は現実的な複雑なシナリオに対して全面的なアップグレードが施されており、話者分割、単語レベルのタイムスタンプ、キーワードの優先設定、および自動言語識別などの機能を統合しています。インディアン英語(Hinglish)、スペイン語と英語の混合語(Spanglish)など、言語の混在現象にも対応しており、非常に高いノイズ耐性を持っています。開発者は、「文字単位での転記」と「簡略化された転記」のスタイルを自由に切り替えることができ、法律、臨床、字幕、高規制分析などの多様な業務環境に正確に適合させることができます。

VIP会員