ホームAIGoogleの手話AI翻訳により、ろう者は文字を入力する代わりに手話で表現できるようになる

Googleの手話AI翻訳により、ろう者は文字を入力する代わりに手話で表現できるようになる

Google DeepMind は、新しい形式の手話 AI 翻訳を公開しました。これにより、聴覚障害のあるユーザーは文字入力の代わりに、スマートフォンに直接手話で伝えることができるようになりました。同社はこれを、アクセシビリティ技術における真のブレークスルーだと位置づけています。2026 年 8 月 12 日に発表されたこのモデルは SL2T(sign-language-to-text(手話からテキスト) の略)と呼ばれ、この種の技術が研究室の段階を超え、Gboard や Live Transcribe(音声文字変換) といった日常的なコンシューマー向けアプリに初めて搭載されたことを意味します。

主なポイント

  • Google DeepMind は、手話を直接テキストに変換する多言語手話モデル SL2T を発表しました。
  • 現在は Pixel 11 上の Gboard と Live Transcribe 内で、アメリカ手話(ASL)から英語への変換を追加料金なしでサポートしています。
  • このモデルは 50 を超える手話にわたる 100,000 時間以上のデータで学習されており、FLEURS-ASL ベンチマークで 70 BLEURT を記録し、従来モデルを大きく上回っています。
  • SL2T はユーザーのプライバシーを守るため、生の動画ではなくポーズのランドマークを追跡し、カメラ映像は即座に破棄します。
  • プロジェクトは当初からろう者コミュニティのメンバーと共に進められ、Google は展開を指針するために AI 手話諮問委員会(AISLAC)を設立しました。

Google DeepMind、 多言語手話 AI 翻訳モデル SL2T を発表

SL2T は、長年 AI に存在していたギャップに対する DeepMind の回答です。過去 20 年の間に音声入力や自動翻訳といった音声言語ツールは一般化しましたが、世界に 200 を超える手話があり、推定 7,000 万人のろう者・難聴者が使用しているにもかかわらず、その多くは取り残されてきました。DeepMind は SL2T を、翻訳品質と言語カバレッジの両面で意味のある飛躍をもたらし、このギャップを埋めるために構築された「大規模多言語」システムだと説明しています。

その実用的な成果は、新しい形の音声入力です。聞こえるユーザーが文字入力の代わりに話すことができるのと同様に、SL2T によってろう者のユーザーは、ウェブ検索、メッセージやドキュメントの作成、Gemini へのタスク依頼など、本来文字を入力するあらゆる場面でスマートフォンに手話で伝えることができます。Live Transcribe 内では、聞こえる人とのやり取りで、文字を打ち合う代わりに、自分側の発話を手話で行うことができます。Google 自身のテスターによれば、ASL で手話をする方が、同等の内容を英語でタイプするよりも速く、自然に感じられたといいます。

Pixel 11 上の Gboard と Live Transcribe における ASL 対応

現時点では、この技術がサポートする言語ペアは 1 つだけです。アメリカ手話から英語への翻訳です。まずは Pixel 11 上の Gboard と Live Transcribe 内で利用可能となり、Google は今後、対応デバイスと対応手話言語を順次拡大すると約束しています。特筆すべきは、この機能がユーザーに対して追加料金なしで提供されている点であり、プレミアムな有料オプションではなく、標準的なアクセシビリティ機能として位置づけられていることです。

多言語手話モデルはどのように構築されたか

SL2T は、100,000 時間以上50 を超える手話にまたがるデータセットで学習されており、そのうち約 4 分の 1 が ASL のデータです。個別の単一言語システムを構築するのではなく、多数の言語と習熟度レベルを同時に学習させることで、モデルは共通する構造を学び、全体的な性能を向上させました。DeepMind 自身のテストでは、単一言語モデルを上回る結果が得られています。

そのスケールは数値にも表れています。ASL から英語への翻訳品質を測る FLEURS-ASL ベンチマークにおいて、SL2T はゼロショットで70 BLEURT というスコアを記録しました。これは、この種のタスクに対してこれまで報告されてきたどの数値よりも有意に高いと DeepMind は述べています。この差は重要です。SL2T が単なる小幅な改善ではなく、手話を単なる単語に対応づけられた一連の手の動きではなく、完全な言語としてどれだけよく理解できるかという点で、段階的な変化を示しているからです。

難しさの一因は、手話が「話し言葉を手で表現したもの」にとどまらないことにあります。手話は独自の文法、語彙、構造を持ち、両手、腕、胴体、頭、顔の同時的な動きによって意味を伝えます。これらすべてをリアルタイムで追跡することは高度なコンピュータビジョンの課題であり、過去の試み(手話グローブなど)が苦戦した理由の 1 つでもあります。そうした試みは、手話を本物の言語翻訳ではなく、限定的な手の動きの追跡タスクとして扱っていたからです。

ポーズのランドマークで手話使用者のプライバシーを保護

SL2T は、生の動画をサーバーに送信するのではなく、手話をポーズのランドマーク座標のストリームとして処理します。MediaPipe Holistic と呼ばれるオンデバイスモデルが手話使用者の身体上のポイントを追跡し、翻訳に送信されるのはそれらの幾何学的な座標だけで、カメラ映像そのものは送られません。元の動画は即座に破棄されます。これは、プライバシー保護を後付けではなく、システムアーキテクチャそのものに組み込むという DeepMind のアプローチです。

グロスを介さず直接翻訳して精度を向上

SL2T は、従来の手話研究でよく用いられてきた手法とも一線を画しています。座標列を、途中の段階的な注釈(「グロス」と呼ばれる)を経由せずに、直接テキストへと翻訳するのです。グロスは、顔の表情や空間的な構成など、手話におけるより豊かで非線形な要素を見落としがちです。これらは実際に意味を担っています。このステップを省くことで、SL2T は人工的な語彙の制約を避け、データ量の増加に応じて翻訳品質を直接スケールさせることができます。

Google は、ベンチマークスコア以外の実務的・現実的な課題にも取り組んだと述べています。ストリーミング遅延の削減、実際には手話をしていないときの誤翻訳の回避、左利きの手話使用者(全体の約 10%)や、片手でスマートフォンを持ちながらもう一方の手だけで手話をする人に対する精度向上などです。

ろう者コミュニティが SL2T の開発を形作った

DeepMind はこれを、単にろう者コミュニティ「のため」にではなく、ろう者コミュニティ「と共に」構築されたプロジェクトだと位置づけています。このアイデアは、ろう者の Googler である Sam Sepah 氏から生まれ、データ収集、ユーザーテスト、技術の現実世界への影響評価に至るまで、ろう者のパートナーが関わってきました。

初期リリース後もその関与を体系的に維持するため、Google はAI 手話諮問委員会(AISLAC)を設立しました。世界各地のろう者団体や専門家を集め、今後この技術をどのように展開していくかを共に検討していきます。また同社は、コミュニティパートナーと共同で、この初回リリースに関する共同インパクトレポートも作成しました。そこでは、SL2T に何ができ、現時点でどのような限界があるのかが示されています。Google は、今後の手話関連リリースについても同様のアプローチを繰り返す意向だと述べています。

手話 AI 翻訳の今後

DeepMind は、ASL 対応をゴールではなくスタート地点として位置づけています。チームは、SL2T を他の手話言語へ拡張すること、テキストを手話出力へと変換する、いわば逆方向のプロセスである手話生成の探求、そして既存モデルの上にさらに高度な AI 機能を追加することに取り組んでいるとしています。

より広い野心は、Google が長年掲げてきた「世界中の情報をあまねく誰もがアクセスできるようにする」という目標に結びついています。ろう者コミュニティにとってそれを実現するには、単一のデバイスに 1 つの機能を搭載するだけでなく、デジタルプロダクト全般において、手話を音声言語や書記言語に近いレベルまで引き上げる必要があります。SL2T の初期の ASL における成果が、文法や地域差の異なる数十の手話へと拡大した際にも維持されるかどうかは、Pixel 11 を超えたユーザーにとって、このより広いビジョンがどれだけ早く現実のものとなるかを左右するでしょう。

FAQ

SL2T とは何で、何ができるのですか?

SL2T は、Google DeepMind の多言語対応の手話からテキストへの変換モデルです。手話を直接テキストに翻訳し、ろう者のユーザーがキーボードの代わりにスマートフォンに手話で伝えて、メッセージ入力、検索、コミュニケーションなどを行えるようにします。

現在 SL2T がサポートしている手話はどれですか?

現時点では、SL2T がサポートしているのはアメリカ手話から英語への翻訳のみで、Pixel 11 上の Gboard と Live Transcribe を通じて利用できます。今後のリリースで、追加の手話言語への対応が予定されています。

SL2T は手話翻訳の際にどのようにユーザープライバシーを保護しますか?

SL2T は、オンデバイスのトラッキングシステムを実行し、生の動画をどこかに送信するのではなく、手話使用者の身体上のポイントを読み取ります。翻訳に使われるのはそれらの座標だけで、カメラ映像そのものはすぐに破棄されます。

SL2T プロジェクトには、どのようにろう者コミュニティが関わっていますか?

ろう者の個人は、初期のコンセプト段階からデータ収集、テスト、ガバナンスに至るまで関与してきました。Google はまた、ろう者団体や専門家で構成される AI 手話諮問委員会を設置し、この技術が今後どのように発展していくかを共に検討しています。

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”SL2T とは何で、何ができるのですか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”SL2T は、Google DeepMind の多言語対応の手話からテキストへの変換モデルです。手話を直接テキストに翻訳し、ろう者のユーザーがキーボードの代わりにスマートフォンに手話で伝えて、メッセージ入力、検索、コミュニケーションなどを行えるようにします。”}},{“@type”:”Question”,”name”:”現在 SL2T がサポートしている手話はどれですか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”現時点では、SL2T がサポートしているのはアメリカ手話から英語への翻訳のみで、Pixel 11 上の Gboard と Live Transcribe を通じて利用できます。今後のリリースで、追加の手話言語への対応が予定されています。”}},{“@type”:”Question”,”name”:”SL2T は手話翻訳の際にどのようにユーザープライバシーを保護しますか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”SL2T は、オンデバイスのトラッキングシステムを実行し、生の動画をどこかに送信するのではなく、手話使用者の身体上のポイントを読み取ります。翻訳に使われるのはそれらの座標だけで、カメラ映像そのものはすぐに破棄されます。”}},{“@type”:”Question”,”name”:”SL2T プロジェクトには、どのようにろう者コミュニティが関わっていますか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”ろう者の個人は、初期のコンセプト段階からデータ収集、テスト、ガバナンスに至るまで関与してきました。Google はまた、ろう者団体や専門家で構成される AI 手話諮問委員会を設置し、この技術が今後どのように発展していくかを共に検討しています。”}}]}

本記事は人工知能の支援を受けて作成され、編集チームによる確認を経ています。

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST