毎朝更新
← 今日のニュース2026.08.12 / Fujin編集約7分で読めます

手話をスマホへかざすと文字になる——DeepMindがPixel 11へ届けた「見る言語」のAI

声で文字を入力できる人には、音声入力は当たり前の機能です。でも手話を第一言語にする人は、同じ便利さを使えませんでした。SL2Tは、その入り口をスマートフォンへ持ってきます。

01 / QUICK GUIDE

まず、30秒でつかむ

  • 01

    Google DeepMindは2026年8月12日、手話の動きを読み取り、文章へ訳す多言語モデルSL2Tを発表しました。Androidチームと共同で製品へ組み込んでいます。

  • 02

    最初はPixel 11のGboardとLive Transcribeで、アメリカ手話から英語への変換を追加料金なしで提供します。他の端末と言語は今後対応する計画です。

  • 03

    モデルは50を超える手話の10万時間超のデータで訓練されました。ただし公開評価は開発元によるもので、速い指文字や珍しい手話、文脈が必要な表現では誤りが残ります。

02 / KEY WORDS

専門用語を、やさしく。

ここだけ押さえれば、残りの本文はスムーズに読めます。

SL2T
Sign-Language-to-Textの略で、手や顔、体の動きで表す手話を、書かれた言語へ翻訳するAIです。単語の置き換えではなく、異なる言語同士の翻訳を行います。
ASL
American Sign Language、つまりアメリカ手話です。英語とは別の文法と語彙を持つ自然言語で、英語を手の形に置き換えただけのものではありません。
姿勢ランドマーク
手、顔、腕、体などの位置を点と座標で表したデータです。SL2Tでは端末上の仕組みが映像から座標を取り出し、翻訳へ使います。
BLEURT
翻訳文が人の用意した正解文と意味的にどれほど近いかを、学習済みモデルで測る評価指標です。数値は正答率ではなく、条件の違う試験と単純比較できません。

03 / THE FACTS

何が起きたのか

Google DeepMindは8月12日、手話を流れる文章へ変換するSL2Tを発表しました。公式ページには日付だけがあり、公開時刻とタイムゾーンは示されていません。

SL2Tは、50を超える手話から集めた10万時間超のデータで共同学習されました。およそ4分の1はASLです。異なる言語、方言、習熟度を一緒に学ぶことで、単一言語だけのモデルを同社実験で上回ったとしています。

最初の製品はPixel 11のGboardとLive Transcribeです。Gboardでは手話を検索や入力に使い、Live Transcribeでは会話中の返事をタイピングせず手話から文章へ変えられます。追加料金はないと説明されています。

プライバシー対策として、MediaPipe Holisticという端末上のモデルが映像を姿勢ランドマークへ変え、翻訳サーバーには幾何学的な座標だけを送ります。元のカメラ映像は直ちに破棄するとGoogleは説明しています。

FLEURS-ASLの試験では、事前にその課題専用の学習をしないzero-shot条件でBLEURT 70を記録しました。一方、公開例には速い指文字の『prey』を『grey』とした誤り、細部の欠落、時制の間違いも示されています。

THE CONCLUSION

つまり、何が重要なのか

結論から言うと、SL2Tの大きさは研究室のデモで終わらず、文字入力と会話支援の機能として一般向けスマートフォンへ入ったことです。利用者は手話でWeb検索、文書作成、メッセージ、Geminiへの依頼を行えます。

ただし、現時点の入口はPixel 11でのASLから英語です。世界には200を超える手話があるとDeepMindは説明しており、『手話対応が完了した』わけではありません。

04 / THE CONTEXT

なぜ、今これが重要なのか

音声認識は、話す、文字にする、翻訳するという流れを何年もかけて日常機能にしました。一方、手話は手だけでなく、顔、頭、胴体、空間を同時に使うため、映像処理と翻訳の負担が大きく、製品化が遅れていました。

手話は、音声言語を身振りへ写したものではありません。独自の文法を持つため、手の形を順番に単語へ直すだけでは意味が抜けます。全身の座標から文章へ直接訳す技術が必要でした。

端末側で体の点を高速に取り出す技術と、多言語データをまとめて学ぶモデルが組み合わさり、スマートフォン上で待たされにくい入力として提供できる段階へ進みました。

05 / WHAT IT MEANS FOR YOU

私たちには、何が変わる?

ろう者や難聴者にとっては、第二言語である英語をキーボード入力する代わりに、より自然なASLで質問や返信を始められます。情報へたどり着くまでの負担を下げる可能性があります。

聴者にとっても、手話を一つずつ英単語へ置き換えるものだという誤解を直す機会です。SL2Tは音声の文字起こしではなく、文法の異なる言語を映像から翻訳する仕組みです。

座標だけを送る設計は、生の映像を送るより情報を減らせます。ただし座標も身体の動きを表すデータです。保存期間、利用目的、地域ごとの扱いは、実際の製品説明と設定で確認する必要があります。

BLEURT 70は70%正確という意味ではありません。固有名詞、速い指文字、片手での入力、照明、カメラ位置など、生活環境でどの程度使えるかは利用者の継続的な評価が必要です。

07 / NEXT ACTION

今日から、どう動くか

  1. 01

    手話AIの記事を見るときは、対応する手話と言語、端末、地域、当事者が評価へ参加したかを確認する。

  2. 02

    Pixel 11で利用する場合は、重要な連絡を送る前に変換文を読み返し、固有名詞や数字を手で修正する。

  3. 03

    職場や窓口へ導入するなら、AI翻訳だけに絞らず、手話通訳、文字、音声など本人が選べる連絡手段を残す。

BOTTOM LINE

SL2Tは、手話を話す人が自分の言語のままスマートフォンとAIへ入る道を開きました。これは完成ではなく、ASLとPixel 11から始まる、多言語・多端末への長い一歩です。

今日のAIニュース一覧へ →