アリババは正式に音声認識の大規模モデル「Qwen-Audio-3.0-ASR-Flash」を発表しました。このモデルの核心的な目的は明確です――AIが専門用語を正確に理解することです。このモデルは文脈の一貫性、業界用語の認識およびヒットワードのカスタマイズの3つの次元で体系的な最適化が行われており、音声の修正機能も備えています。構造化テキストを直接出力することが可能です。

image.png

研究チームは医療、ITプログラミング、株式市場、社会的著名人などの分野から専門用語を継続的に掘り下げ、多業種にわたる高品質な語彙ベースを構築しました。最新の業界用語内部評価では、新モデルは各業界の専門用語の「聞き取り率」が明らかに向上しており、医療シーンでは95.36%に達しています。

3つのバージョンが5つのシナリオをカバーし、すでに世界第1位を獲得

Qwen-Audio-ASR-Flashシリーズは会議録整理、リアルタイム字幕、教育録画、スマートカスタマーサービスなどさまざまなシナリオで検証されており、以前にはAI評価プラットフォーム「Artificial Analysis」で1.7%の誤字率で世界第1位を獲得しました。これは、現実的なオフィスや教育環境において、AIによる音声からテキストへの変換精度が使用可能性の限界に近づいていることを意味します。