テンセント・フェンユアンは今日、新世代の音声認識モデル「Hy ASR3.0preview」を正式にリリースしました。最新の大規模言語モデル「Hy3」の言語理解能力をバックボーンとして、高精度な音声認識と深い意味理解を統合し、一般的な認識、文脈感知、多シナリオでのロバスト性、および地方話のカバー範囲という主要な次元で大幅に向上させました。より複雑な現実的な入力でも、正確で連続性があり、ユーザーの意図に近い変換結果を提供することができます——公式の言葉では、「逐字転写、単点最適化」から「文脈を理解し、シナリオに対応し、一発で出力する」へと進化したと言えます。

成績は非常に目覚ましいです。海外オープンソースの評価データセットにおいて、Hy ASR3.0previewは複数の言語の単語誤り率(WER)を3%前後に抑えており、中国語普通話は3.34%、英語は2.62%、広東語は3.12%となっています。テンセント独自の評価データセットにおいても、一般認識、地方話認識、文脈理解、専門語理解、また高騒音やささやきなどの複雑な音響状況においても、WERは低く維持されており、総合評価データセットで最も低い誤り率を達成しています。

