9月24日、Google は Enterprise 向けサービスの Gemini 3.8 Live に映像による応対を追加した。ホテル業界で問われるのは、この動く顔に、何を言い、何を行い、何を伝える権限があるのかということだ。
作業をしながら話し続ける顔
Gemini の音声チームを代表して Shuo-yiin Chang と CJ Zheng が署名した発表で、Google は、ほぼリアルタイムで生成される映像と音声を組み合わせる仕組みを説明している。アバターは聞き、見て、表情と音声に同期した口の動きで応答する。会話を中断せずに、バックグラウンドでツールを呼び出すこともできる。Google はまた、画質を損なわずに97言語を切り替えられると発表している。
発表文に登場するホテルの場面は、デモンストレーションの一つだけだ。宿泊客のチェックイン中に、ツールがバックグラウンドで動作している。これは紹介用の動画であり、実際に利用している施設からの報告ではない。発表には、応答の遅延、精度、エラー率に関する測定値は一切示されていない。
顔が回答に重みを与える
微笑み、こちらを見る顔は、やり取りを理解しやすくする。同時に、誤った回答の信憑性も高める。画面上の誤った文章は、疑いながら読まれる。同じ内容でも、注意深く対応しているように見える人が話すと、確認しようとする気持ちは弱まる。これは Google ではなく筆者の判断だが、外見より先に権限の問題を扱う理由になる。
実際の事例ではなく、仮の状況に置き換えて考えてみよう。あるアバターは空き状況を読み取り、宿泊客に伝えるが、予約を行う権限はない。別のアバターは、確定することも履行することもできない料金や滞在内容の変更に言及する。どちらの場合も、何を参照しているのか、何を約束しているのか、何が人による確認を必要としているのかを、言葉で明確にする必要がある。これほど滑らかに動く顔を前にして、宿泊客が自分だけでその違いを見分けることはないだろう。
発表された透明性の措置が対象とするもの
Google によれば、すべての音声と映像の出力には SynthID の透かしが付けられており、同社はこれを知覚できないものと説明している。その役割は、コンテンツが生成されたものかどうかを、後から検出できるようにすることだ。会話のその場で、人工的に作られた存在と話していることを宿泊客に知らせるものではない。この情報を伝える責任は施設にあり、画面上または口頭で知らせる必要がある。
Google は、参照画像から独自のアバターを作成できるのは、許可リストに登録された企業に限られると説明している。そこで、誰の顔を使うのかという問題が生じる。従業員の顔か、実在する人物の顔か、それとも架空のキャラクターか。発表は、元の画像に関わる権利については扱っていない。
宿泊客に提供する前に施設が検証すべきこと
評価の対象となるのは、回答が得られない場合も含めた、やり取りの全体だろう。滑らかに動くアバターが、判断できる人への連絡を遅らせるなら、サービスの質は低下する。したがって、スタッフへの引き継ぎも画質と同様に検証する必要がある。いつ引き継ぎが始まるのか、何が伝えられるのか、宿泊客が同じ話を繰り返す必要があるのか、という点だ。
視覚的な統一感は、施設が自らを伝える助けになる。しかし信頼は、画面には映らない整合性にかかっている。アバターが行うすべての約束には、確認済みの情報と、その約束に責任を負う、誰なのかが明確な人物が対応していなければならない。
Cette publication est également disponible en :
