騒がしい人混みの中で特定の人の声を正確に聞き取る能力は、人間の聴覚システムにとって簡単なことですが、従来の自動音声認識(ASR)モデルにとっては「カクテルパーティー問題」として長年解決されていない業界の課題でした。この長年の課題を解決するために、小米(レッドミー)は近日、産業レベルの目標話者音声認識の大規模モデルであるCocktailASR-1を正式にオープンソース化しました。
このモデルは従来の音声認識の入力方法を完全に変革し、参照音声の声紋に基づく目標話者識別メカニズムを採用しています。ユーザーは参考となる音声を一つ提供するだけで、モデルは声紋埋め込みを使って目標話者を正確に特定し、複数人の混合音声の中でその特定人物の発話をのみ転記します。他の人の発話やリバーブ、背景ノイズは自動的にフィルタリングされます。これにより、複雑な混合音声のタスクが効率的な目標話者識別のタスクへと変化します。

下位アーキテクチャ設計において、CocktailASR-1はエンドツーエンドの大規模言語モデル構造を採用しており、D2V2音声エンコーダー、Adapterおよび大規模言語モデルデコーダーから構成されています。すべての重みパラメータは同じチェックポイントに統合されています。実際の使用では、入力形式として参照音声と対象のモノラル音声を結合し、間に1秒間の静粛を挟んでいます。この設計により、モデルは非常に高い汎用性を持ち、単一の人だけでなく複雑なマルチシーンでもモデルの切り替えなしにスムーズに行えます。
複数のベンチマークテストデータによって、このモデルの強力な性能が検証されました。多話者シミュレーションテストでは、LibriMix2mixおよびLibriSpeechMix2mixデータセットでの文字誤り率(WER)はそれぞれ4.11%と2.90%に低下しました。一方で、同クラスの多数の有名モデルは混合環境下で全滅したことがわかりました。例えば、LibriMix3mixテストでは一部の競品の文字誤り率が76%から121%に達していたにもかかわらず、CocktailASR-1の文字誤り率はわずか12.29%であり、画期的な優位性を示しました。さらに挑戦的な本物の会議録音場面、例えばAMI SDMやAliMeeting Farでも、このモデルは既存のあらゆるソリューションを大幅に上回りました。単一の人間の状況では、LibriSpeech、WenetSpeech、CommonVoice-zhなどのデータセットでも全面的な優位性を示しました。
精度の飛躍的な向上に加えて、このモデルには工学的実装と実用性において二つの重要な特徴があります。第一に、負例の拒否能力が非常に強力です。参照音声に対応する人が現在の会話に参加していない場合、モデルは空のテキストを直接出力することができ、スマートスピーカーや車載音声アシスタントなどのスマートデバイスが他人の声で誤って起動されるのを効果的に防ぎます。テスト結果によると、複数のデータセットで負例の拒否率は優れています。第二に、モデルは思考チェーン推論機能をサポートしています。最終的な答えを出力する前に、特定のタグを通じて話し手の判断プロセスを表示することができます。この機能は精度への影響が極めて小さくても、システムの説明可能性とデバッグの利便性を大幅に向上させます。
現在、CocktailASR-1の関連コードはGitHubでApache2.0ライセンスに基づいて正式にオープンソース化されており、依存環境は極めてシンプルで、torch、torchaudio、transformers、soundfileなどの基本ライブラリさえあれば、HuggingFaceから簡単に読み込み・展開できます。小米が音声技術の根本的なロジックを新たに方向転換した今回の取り組みは、音声認識が従来の「すべての音を捉える」段階から、「一つの音を正確に捉える」新たな段階へと進化していることを示しています。
VIP会員