人工知能企業のxAIは、近日、次世代の音声認識および生成モデル「Grok Voice Think Fast 2.0」を発表し、開発者向けに全面的に公開しました。このモデルは、スマートなレベル、転記精度、会話インタラクション能力、およびツール呼び出し効率において顕著な向上を遂げており、公式価格は1分間のオーディオあたり0.08ドルです。

権威あるArtificial Analysisの音声認識ベンチマークテストでは、「Grok Voice Think Fast 2.0」の総合スコアは82.9%となり、前バージョンを上回るだけでなく、「GPT-Realtime-2.1」と「Gemini 3.1 Flash」よりも優れています。また、そのエージェント能力スコアは56.5%で、同種のモデルの中でリードを維持しています。応答速度に関しては、このモデルの最初のオーディオ再生時間が大幅に短縮され、0.70秒にまで短縮されており、インタラクティブな体験がよりスムーズになりました。

音声転記精度においては、公式テストによると、新モデルは多言語環境での転記精度が前世代と比べて約1.4倍向上し、複数国語の大規模なオーディオテストにおいて強力な実力を示しています。特に、背景ノイズや電話圧縮などの複雑な現実的なシナリオにおいて、その耐障害性と競合製品との差はさらに広がっています。

技術構造において、「Grok Voice Think Fast 2.0」は音声並列推論メカニズムを導入し、システム待機時間を大幅に短縮しました。対話戦略に対する強化学習による深い最適化により、モデルはより簡潔な回答を出力でき、一度に一つの核心的な問題のみを処理することができ、これにより複雑なタスクにおけるツール呼び出し効率が著しく向上しました。

現在、この技術は実際の業務シナリオで検証されており、Starlinkの電話サービスでA/Bテストが完了し、販売転換率とカスタマーサービス応答効率の両方を効果的に向上させました。公式計画によれば、旧バージョンの識別子は2026年8月5日に自動的に新バージョンに切り替わる予定です。