9月23日、Googleは声を設計し、一行ずつ演出できるとする2つの音声合成モデルを発表しました。メゾンにとって、声は編集上の資産となり、その基準、許可される用途、履歴を定めておく必要があります。
Googleの発表内容
Gemini 3.8 Flash TTSはクリエイティブ・ディレクションを狙ったものです。説明(役柄、アクセント、性格)から100を超える言語と方言で声を設計し、演技、リズム、トーンの指示で各台詞を演出します。Gemini 3.8 Flash-Lite TTSは量を狙ったもので、特に吹き替えや音声エージェントが対象です。Googleは、すぐに使える2,000以上の声、作成した声を保存してプロジェクト間のずれを抑えられること、数時間にわたって安定した音色で連続して使えることを挙げています。ライブラリの声の調整(音色、高さ、アクセント)は、今後提供予定とされています。
同社はまた、Hume AIの声のデザインのランキングで71.4ポイントの1位だと主張しています。発表文ではその手法が詳しく示されていないため、この数字はあくまで提供元のスコアです。
演出される声には基準が必要
声を演出することは、作業の一部を編集上のディレクションへ移すことを意味します。声が適切である理由を言葉にできなければなりません。メゾンの名前の発音の仕方、抑制、文の前の沈黙などです。形容詞だけでは、それを伝えるには不十分です。承認され、聞かれ、コメントが付いた抜粋のほうが優れており、バージョンや言語を越えて基準となる同一のテキストを用意し、固有名詞、聞き取りやすさ、意図について各言語で人間が聞き取る必要があります。書き言葉として正しい文が、話すとうまく響かないことがあります。
許可される用途:地図は一様ではない
複製については、Googleは、声を複製される本人の口頭による同意の録音を求めており、それは参照サンプルと一致していなければなりません。30秒の音声で足り、それは利用者自身の声か、権利を保有する声のものです。Googleによれば、各抜粋にはSynthIDの透かしが入り、複製された声にはC2PAの証明が付されます。
これらの信号が証明するのはファイルの出自であり、合意の範囲ではありません。作成された声、複製された声、ライブラリの声は、それぞれ異なる許諾を要し、各々について合意した用途とともに記録されるべきです。
次に地理の問題が残ります。Googleは、開発者向けツールからの複製は、フランスを含む欧州経済領域、英国、スイス、インドでは提供されないと明記しています。この制限は、品質を論じる以前に、フランスのメゾンの判断を変えます。企業向けのGemini Enterpriseを通じた提供は、後日とされています。
各バージョンを見つけ直す
Googleは、声が「保存され、管理される」と約束しています。発表には履歴についての記述がありません。変更後も声の旧バージョンは保持されるのか、復元できるのか、どのファイルがどのバージョンで生成されたのか分かるのか。生成の容易さは、こうした判断を増やします。調整のたびに、後で位置づけられなければならない派生版が生まれるのです。
メゾンは簡単な台帳をつけることができるでしょう。各声について、種類、担当者、合意した用途、各バージョンの日付、古いものを取り下げる条件を記します。判断を下す人が管理するこの台帳こそが、声をメゾンの声にします。
Cette publication est également disponible en :
