Google DeepMindが8月12日、手話をそのまま文字にするモデルSL2Tを公開した。Pixel 11のGboardとLive Transcribeに載り、アメリカ手話を英語のテキストに変える。仕組みで目を引くのは、端末が撮った映像を送らないところだ。体の点の座標だけを送り、映像はその場で捨てる。入力の話であり、同時に「何を外へ渡すか」の話でもある。
いま動くのは、アメリカ手話から英語への一方向だけだ
語の範囲を絞っておきたい。学習には50以上の手話、およそ10万時間分が使われている。ただし実際に使えるのはアメリカ手話から英語への変換で、対象の端末はPixel 11。DeepMindは「対応端末は近く増え、言語も追って加わる」と書いている。逆方向——文字から手話を作るほう——は、今後取り組む対象として挙げられている段階だ。
手話は国や地域ごとに異なる言語で、日本手話がこの発表に含まれているわけではない。「手話が文字になった」と一般化すると、いま手元で使える範囲を大きく外れる。
送られるのは映像ではなく、骨格の座標だ
処理は二段に分かれている。まず端末の中でMediaPipe Holisticというモデルが、体の点の位置を追う。DeepMindの説明では「これらの幾何学的な座標だけがサーバーに送られて翻訳される」。元の映像は直ちに破棄されると書かれている。翻訳そのものはサーバー側で走る。
つまり端末内で完結する仕組みではない。ただし、外へ出ていくものの中身が違う。カメラの前で手話をするということは、顔も部屋も一緒に写るということだ。座標の列だけが出ていく設計は、その部分を最初に落としている。
「手元で処理して、要るものだけ送る」という形は、手話に限った話ではない。カメラやマイクを開けたまま使う道具が増えるほど、何を送っているかは選ぶ対象になる。
苦手な場所は、はっきり書かれている
未成熟な部分も一緒に出ている。DeepMindはFLEURS-ASLというベンチマークで70 BLEURTを記録し、これまで報告されたどのスコアよりも大幅に高いとしている。そのうえで、誤りが残る場所を具体的に挙げている。珍しい手話、速い指文字(「prey」が「grey」になる)、受動の構文、分類詞による描写(「爪」が落ちる)、文脈のない時制。
片手での手話と、左利きの人(利用者の1割とされる)に向けた調整も行ったと書かれている。裏を返せば、調整が要るほど手話の形は人によって違うということだ。
正確さが要る場面——医療の窓口、契約、行政の手続き——で、この段階の変換をそのまま頼るのは早い。日常の入力と、間違えられない場面の通訳とでは、必要な精度が違う。
「打つ」以外の入り口が増えるとき
スマホの入力は長いあいだ、指で打つか、声で言うかの二択に近かった。声が使えない場面や、そもそも声を使わない人にとっては、実質一択だったことになる。そこに三つ目が加わる。
これは特定の誰かのための機能に見えて、入力という前提そのものを緩める話でもある。手を動かす、指す、書く、打つ、話す。道具の側が受け取れる形が増えるほど、自分に合ったやり方を選ぶ余地が出てくる。
同時に、増えた入り口はカメラやマイクを開けておくことでもある。何を渡して、何を渡さないか。今回のように「座標だけ」と設計が書かれているものもあれば、そうでないものもある。
あなたが毎日使っている道具は、あなたの何を受け取り、その先へ何を送っているだろうか?