本文へ移動
LIFEMAKERS.COM — 自立型ライフの実践知カタログベータ版
Signal観測テクノロジーと道具FUTURE LIFE BRIEF

GoogleのSL2Tが手話を文字にし始めた——端末から送られるのは映像ではなく、骨格の座標だ

手話をそのまま文字にするモデルがPixel 11に載った。使えるのはアメリカ手話から英語への一方向だけ。仕組みで目を引くのは、映像を送らずに体の点の座標だけを送る設計のほうだ。

GoogleのSL2Tが手話を文字にし始めた——端末から送られるのは映像ではなく、骨格の座標だのイメージ

この記事でわかること

  • Google DeepMindのSL2TがPixel 11のGboardとLive Transcribeに載り、アメリカ手話を英語のテキストに変換する
  • 端末内で体の点の座標だけを抽出してサーバーに送り、元の映像はその場で破棄される設計
  • 誤りが残る場所は公式に列挙されている。速い指文字、受動の構文、文脈のない時制など

Google DeepMindが8月12日、手話をそのまま文字にするモデルSL2Tを公開した。Pixel 11のGboardとLive Transcribeに載り、アメリカ手話を英語のテキストに変える。仕組みで目を引くのは、端末が撮った映像を送らないところだ。体の点の座標だけを送り、映像はその場で捨てる。入力の話であり、同時に「何を外へ渡すか」の話でもある。

いま動くのは、アメリカ手話から英語への一方向だけだ

語の範囲を絞っておきたい。学習には50以上の手話、およそ10万時間分が使われている。ただし実際に使えるのはアメリカ手話から英語への変換で、対象の端末はPixel 11。DeepMindは「対応端末は近く増え、言語も追って加わる」と書いている。逆方向——文字から手話を作るほう——は、今後取り組む対象として挙げられている段階だ。

手話は国や地域ごとに異なる言語で、日本手話がこの発表に含まれているわけではない。「手話が文字になった」と一般化すると、いま手元で使える範囲を大きく外れる。

送られるのは映像ではなく、骨格の座標だ

処理は二段に分かれている。まず端末の中でMediaPipe Holisticというモデルが、体の点の位置を追う。DeepMindの説明では「これらの幾何学的な座標だけがサーバーに送られて翻訳される」。元の映像は直ちに破棄されると書かれている。翻訳そのものはサーバー側で走る。

つまり端末内で完結する仕組みではない。ただし、外へ出ていくものの中身が違う。カメラの前で手話をするということは、顔も部屋も一緒に写るということだ。座標の列だけが出ていく設計は、その部分を最初に落としている。

「手元で処理して、要るものだけ送る」という形は、手話に限った話ではない。カメラやマイクを開けたまま使う道具が増えるほど、何を送っているかは選ぶ対象になる。

苦手な場所は、はっきり書かれている

未成熟な部分も一緒に出ている。DeepMindはFLEURS-ASLというベンチマークで70 BLEURTを記録し、これまで報告されたどのスコアよりも大幅に高いとしている。そのうえで、誤りが残る場所を具体的に挙げている。珍しい手話、速い指文字(「prey」が「grey」になる)、受動の構文、分類詞による描写(「爪」が落ちる)、文脈のない時制。

片手での手話と、左利きの人(利用者の1割とされる)に向けた調整も行ったと書かれている。裏を返せば、調整が要るほど手話の形は人によって違うということだ。

正確さが要る場面——医療の窓口、契約、行政の手続き——で、この段階の変換をそのまま頼るのは早い。日常の入力と、間違えられない場面の通訳とでは、必要な精度が違う。

「打つ」以外の入り口が増えるとき

スマホの入力は長いあいだ、指で打つか、声で言うかの二択に近かった。声が使えない場面や、そもそも声を使わない人にとっては、実質一択だったことになる。そこに三つ目が加わる。

これは特定の誰かのための機能に見えて、入力という前提そのものを緩める話でもある。手を動かす、指す、書く、打つ、話す。道具の側が受け取れる形が増えるほど、自分に合ったやり方を選ぶ余地が出てくる。

同時に、増えた入り口はカメラやマイクを開けておくことでもある。何を渡して、何を渡さないか。今回のように「座標だけ」と設計が書かれているものもあれば、そうでないものもある。

あなたが毎日使っている道具は、あなたの何を受け取り、その先へ何を送っているだろうか?

参照

あなたの暮らしで、最初に試せることは何でしょうか。