Googleはこのたび、Geminiシリーズの最新の音声認識モデルであるGemini3.5Transcribeを正式にリリースし、これを同シリーズでこれまでで最も高い精度を持つ音声認識モデルとして位置付けています。このモデルは開発者、企業、そして一般ユーザーすべてに対して公開され、騒音が多かったり、専門的な用語が含まれていたり、自然な口語表現が使われているなど、業界で長年課題とされてきた認識の問題を重点的に解決しています。

技術的な面やアプリケーションの場面において、Gemini3.5Transcribeは強力な汎化能力を示しています。新しいモデルは背景ノイズを効果的にフィルタリングするだけでなく、専門分野における複雑な語彙にも優れたサポートを提供します。現在、このモデルはmacOSプラットフォーム上のGeminiアプリおよびAndroidプラットフォームのGboardキーボードのRambler機能において顕著な性能向上をもたらしています。開発者にとっては、このツールを活用して効率的に音声インテリジェンスエージェント、リアルタイム字幕ツール、通話後の分析プロセスなどの革新的なアプリケーションを構築することが可能です。

image.png

日常会話の複雑さに応じて、新モデルは機能設計においていくつかの細かい最適化を行っています。これは話し手の自然な意味的意図をよりよく捉え、カスタム語彙を識別し、ユーザーが音声によってさまざまなタスクをスムーズに完了できるように補助します。また、このモデルは自動的な自己修正、「えー」や「あー」などの口語的なフィラー語のスマートなフィルタリングと削除、出力テキストの自動形式化などの実用的な機能を内蔵しています。さらに想像力を働かせると、ファイル分析や画像生成などのより複雑な連鎖的なタスクを他のGeminiモデルに委譲でき、ユーザーに一貫したマルチモデル協働体験を提供します。

客観的な転写正確性の面では、Googleが公開したデータによると、Gemini3.5Transcribeはストリーミング音声認識のシナリオにおいて平均単語誤り率(WER)がわずか4.0%であり、非ストリーミングのシナリオでは大幅に2.6%まで低下しています。騒音が多い複雑な環境でも非常に高い認識の安定性を維持しており、アルファベットと数字が混在している重要な情報(注文番号、郵便番号など)の認識もより正確かつ間違いがないです。

多言語対応とカスタマイズ可能な適応性においても、このモデルは目覚ましいパフォーマンスを示しています。現在、サポートされている言語は85種類に達し、地域ごとの発音や方言の変異に対応できます。前処理された音声に対しては、最大3人の異なる話者に対してタイムスタンプ付きの音声帰属識別を提供します。さらに、ユーザーが独自の語彙リストをサポートし、あらゆる業界の専門用語、特殊なスペル、固有名称に完璧に対応できます。

オープンなペースと製品エコシステムの連携に関して、開発者はすでにGoogle AI StudioやGoogle Antigravity内のGemini APIを通じて、公開プレビューの形でGemini3.5Transcribeを先に体験することができ、一般ユーザーは直接AndroidおよびmacOSプラットフォームで日常的に体験できます。今後、GoogleはChromeブラウザにシームレスに統合する予定で、ユーザーが任意のウェブページの入力ボックスで音声による直接入力を簡単に実現できるようになります。以前にGemini3.7Flashをリリースし、Gemini in Chromeが米国の全Androidユーザーに完全公開され、アシスタントがWaymoの自律走行タクシーに接続されたことを考慮すると、Googleは極めて速いペースでその全シーン向けAI製品マトリクスを継続的に改善しています。