OpenAIが新世代の対話モデルをリリースし、ChatGPTの音声機能をアップグレードして数週間後、Anthropicは7月23日にClaudeの音声モードに関する重要なアップデートを正式に公開しました。ユーザーは今やOpus、Sonnet、Haikuという3つの異なるレベルのモデルの間で自由に切り替えることができます。音声モードはデフォルトで、ユーザーがテキストチャットで最後に使用したモデルに基づいて自動的に最も高速なバージョンにマッチングされます。

image.png

Claudeの音声モードは昨年リリースされたもので、以前は速度が速いが能力に制限があるHaikuモデルによって動作していました。応答は迅速でしたが、複雑なタスクには適していませんでした。今回のアップデートにより、長時間の会話におけるパフォーマンスが大幅に向上しました。公式によると、新しい音声モードはユーザーのコミュニケーションスタイルに合わせたフィードバックを提供でき、ユーザーがカスタマープレゼンテーションを練習するのをサポートしたり、製品市場調査の計画を一緒に構築することもできます。大きな特徴は、アプリケーションエコシステムとの統合能力であり、このシステムはGmail、Google Calendar、Slack、Canva、Notionなどのサードパーティアプリを直接呼び出すことができ、ユーザーは音声指令で会議の予定を更新したり、メールを作成したり、Notionで新しいドキュメントを作成したりできます。

一方、OpenAIは音声のトーンと表現スタイルを更新しましたが、現在では外部ツールを直接呼び出して実際の作業を協力して行うことはできません。言語サポートに関しては、Claudeの音声モードは英語、フランス語、ドイツ語、日本語、韓国語など10種類の言語をサポートしており、ユーザーは手動で指定する必要があります。新しい音声モードはすべてのプラットフォームのベータテストユーザーに公開されています。無料ユーザーはHaikuモデルのみを使用でき、最大で1つの外部アプリケーションに接続できます。しかし、Anthropicは今回のアップデートにおいて下位の音声アーキテクチャを変更しておらず、具体的な音声技術スタックについても明かされていません。打ち切り処理などの自然な会話体験においては、おそらく実質的な改善は見られません。