9月23日,Google 发布了两款语音合成模型,称可逐行设计并指导一种声音。对一家品牌机构而言,声音成为一项编辑资产,其基准、允许的用途和历史都需要确定。
Google 宣布了什么
Gemini 3.8 Flash TTS 面向创意指导:可依据描述(角色、口音、性格)在一百多种语言和方言中设计声音,再通过表演、节奏和语气方面的提示指导每一句台词。Gemini 3.8 Flash-Lite TTS 面向大批量场景,尤其是配音和语音代理。Google 提到有2000多种现成声音,可保存已创建的声音以减少不同项目之间的偏移,并可连续数小时保持稳定的音色。对资料库中声音(音色、音高、口音)的调整,则被宣布为即将推出。
该公司还称在 Hume AI 的声音设计排行榜上位居第一,得分71.4。公告正文并未详述其方法,因此这一数字仍属供应商自报的分数。
被指导的声音需要一个基准
指导一种声音,会把部分工作转移到编辑指导上。需要能够说清楚怎样的声音才算恰当:品牌名称的读法、一种克制、一句话之前的停顿。仅靠形容词难以传达这些。经过认可、聆听并加注评语的片段更为有效,同一段文本可作为不同版本和语言之间的参照,并在每种语言中由真人聆听,核对专有名词、清晰度与意图。书面上正确的句子,说出来可能并不妥当。
允许的用途:版图并不均衡
对于声音复制,Google 要求录制被复制声音者的口头同意,且须与参考样本相符。30秒音频即可,可以是用户本人的声音,或其拥有权利的声音。据 Google 称,每个片段都带有 SynthID 水印,复制的声音还附有 C2PA 证明。
这些信号证明的是文件的来源,而非协议的范围。创建的声音、复制的声音和资料库中的声音需要不同的授权,每一种都应连同约定的用途一起记录在案。
还有地域问题。Google 指出,其开发者工具中的声音复制功能不在欧洲经济区(包括法国)提供,在英国、瑞士和印度也不提供。这一限制甚至在质量之前就改变了法国品牌机构的考量。此外,通过 Gemini Enterprise 向企业开放的访问被宣布为稍后推出。
找回每一个版本
Google 承诺声音可以“被保存和管理”。公告中没有任何内容描述历史记录:修改后是否保留声音的旧版本,能否恢复,是否知道哪个文件是用哪个版本生成的?生成的便捷会使这些决定成倍增加。每一次调整都会产生一个之后需要能够定位的变体。
一家品牌机构可以保存一份简单的登记册:记录每种声音的类型、负责人、约定的用途、每个版本的日期,以及撤下旧版本的条件。正是这份由拍板者保管的登记册,才使声音成为品牌机构的声音。
Cette publication est également disponible en :
