グーグル傘下のDeepMindは、新規の多言語手話からテキストへの変換モデル「SL2T」を発表し、これをPixel 11のスマホシステムに搭載しました。これは初めて手話AIが一般的な消費者向け電子機器に導入されたものです。このモデルはGboardキーボードとLive Transcribeに最初に接続され、ユーザーはフロントカメラを使って手話の動作を行うことで、メッセージの編集、ウェブ検索およびGeminiとの会話を可能にし、従来のキーボード入力に代わる機能を提供します。

SL2Tは50種類以上の手話、合計10万時間の手話素材に基づいて訓練されており、その約四分の一はアメリカン・サイン・ランゲージ(ASL)データセットからです。異なる手話間の共通的な動作論理を学習するため、言語間の共同トレーニングが行われました。FLEURS-ASLテストで手話転写モデルの記録を更新しました。従来の固定語彙タグに依存する方法とは異なり、SL2Tは人体の動作を直接解析してテキストを生成でき、顔の表情、体の空間的位置、口元の動きなどの非手部の意味情報を同時に処理できます。

プライバシーの面では、スマートフォン端末のMediaPipe Holisticが手首、顔、体幹の130か所の重要なポイントをリアルタイムでトラッキングし、外部に送信されるのは動作の座標のみであり、元のビデオは即座に削除され、クラウドにはアップロードされません。現在この機能はアメリカン・サイン・ランゲージ(ASL)から英語への変換にのみ対応しており、グーグルは今後さらに多くの手話およびAndroid機種を拡張する予定です。

DeepMindは2025年5月に手話翻訳モデル「SignGemma」をオープンソース化し、SL2Tの実用化にアルゴリズムの基盤を提供しました。また、WaveNet、Euphonia、およびLive Transcribeなどのアクセシビリティ技術も、音声や視覚のマルチモーダル経験を蓄積しています。グーグル、科大訊飛(iFlytek)、Huawei、Appleが継続的にこの分野に注力していることにより、AIによるアクセシビリティのインタラクションは研究検証から消費製品へと加速して進んでいます。