9月24日,Google 在其 Enterprise 服务中为 Gemini 3.8 Live 加入了视频形象。对酒店业而言,问题在于这个会动的面孔有权说什么、做什么,以及传递什么信息。
一边工作,一边继续说话的面孔
在由 Shuo-yiin Chang 和 CJ Zheng 代表 Gemini 音频团队署名的公告中,Google 描述了将语音与近乎实时生成的视频结合起来的功能。虚拟形象会聆听、注视,并配合表情和同步的口型作出回应。它可以在后台调用工具,而不中断对话。Google 还宣布,可以在97种语言之间切换,且不会降低图像质量。
文中唯一的酒店场景是一段演示:客人在酒店办理入住手续,同时工具在后台运行。这是一段介绍视频,并非来自实际使用该功能的酒店的反馈。公告没有提供任何关于响应延迟、准确度或错误率的测量数据。
面孔让回答更有分量
一张会微笑、会注视的面孔,让交流更容易理解,也让错误的回答更可信。人们看到屏幕上有误的文字时,会带着怀疑阅读;同样的内容由一个看起来很专注的人说出时,人们却不那么愿意核实。这是作者的判断,并非 Google 的观点,但它说明,有必要先讨论授权范围,再讨论外观。
不妨将这一思路放到假设情境中,而不是描述真实案例。一个虚拟形象读取可预订情况并告知客人,却无权进行预订。另一个提到某个价格或住宿安排的变更,却既无法确认,也无法兑现。在这两种情况下,措辞都必须说明:查询的是什么,承诺的是什么,还有什么需要由人来确认。面对这样一张动作流畅的面孔,客人不会自行分清这些区别。
所宣称的透明措施涵盖什么
Google 表示,所有音频和视频输出都带有 SynthID 水印,并称其无法被感知。这种水印的作用,是让人们能够在事后检测出内容是生成的。它并不会在交谈当下告知客人,自己正在与一个合成形象对话。提供这一信息是酒店的责任,酒店应在屏幕上说明或口头告知。
Google 明确指出,只有列入许可名单的企业,才能根据参考图像创建定制的虚拟形象。于是,面孔的选择成为问题:使用员工的面孔、某个真实人物的面孔,还是虚构角色的面孔?公告并未讨论原始图像所涉及的权利。
向客人开放之前,酒店应测试什么
评估应涵盖完整的交流过程,包括无法给出回答的情况。一个动作流畅的虚拟形象,如果延误了客人与能够作出决定的人取得联系,就会降低服务质量。因此,将对话转交给团队的过程,应与图像质量一样接受测试:何时触发转交,传递哪些信息,以及客人是否需要重复自己的话。
视觉上的一致性有助于酒店展示自身。但信任取决于一种屏幕无法呈现的一致性:虚拟形象作出的每一项承诺,都必须对应经过核实的信息,并有一位身份明确的人为其负责。
Cette publication est également disponible en :
