Gemini 3.8 TTS permet de créer des voix ; reste à savoir les retrouver

by PASCAL IAKOVOU
0 comments

Le 23 septembre, Google a présenté deux modèles de synthèse vocale qui promettent de concevoir et de diriger une voix ligne par ligne. Pour une Maison, une voix devient un actif éditorial dont il faut fixer la référence, les usages permis et l’historique.

Ce que Google annonce

Gemini 3.8 Flash TTS vise la direction créative : concevoir une voix à partir d’une description (rôle, accent, caractère) dans plus de cent langues et dialectes, puis diriger chaque réplique avec des indications de jeu, de rythme et de ton. Gemini 3.8 Flash-Lite TTS vise le volume, notamment le doublage et les agents vocaux. Google cite plus de 2 000 voix prêtes à l’emploi, la possibilité d’enregistrer les voix créées pour limiter la dérive d’un projet à l’autre, et une durée continue de plusieurs heures avec un timbre stable. La retouche d’une voix de la bibliothèque (timbre, hauteur, accent) est annoncée comme à venir.

L’entreprise revendique aussi la première place du classement de conception de voix de Hume AI, avec 71,4 points. L’annonce n’en détaille pas la méthode dans son texte, donc le chiffre reste un score du fournisseur.

Une voix qui se dirige demande une référence

Diriger une voix déplace une partie du travail vers la direction éditoriale. Il faut savoir dire ce qui rend une voix juste : la façon de prononcer un nom de Maison, une retenue, un silence avant une phrase. Des adjectifs suffisent mal à transmettre cela. Des extraits approuvés, écoutés et commentés, valent mieux, avec un même texte servant de repère entre les versions et les langues, et une écoute humaine dans chaque langue pour les noms propres, l’intelligibilité et l’intention. Une phrase correcte à l’écrit peut se dire mal.

Usages permis : la carte est inégale

Pour la réplication, Google demande l’enregistrement d’un consentement oral de la personne dont la voix est reproduite, qui doit correspondre à l’échantillon de référence. Trente secondes d’audio suffisent, de la voix de l’utilisateur ou d’une voix dont il détient les droits. Chaque extrait porte le filigrane SynthID, et les attestations C2PA accompagnent les voix répliquées, selon Google.

Ces signaux prouvent l’origine d’un fichier, pas l’étendue de l’accord. Une voix créée, une voix répliquée et une voix de bibliothèque appellent des autorisations différentes, et chacune devrait être consignée avec ses usages convenus.

Reste la géographie. Google précise que la réplication depuis son outil de développement n’est pas proposée dans l’Espace économique européen, ce qui inclut la France, ni au Royaume-Uni, en Suisse ou en Inde. Cette limite change le raisonnement d’une Maison française avant même celui de la qualité. De son côté, l’accès pour les entreprises via Gemini Enterprise est annoncé pour plus tard.

Retrouver chaque version

Google promet des voix « enregistrées et gérées ». Rien dans l’annonce ne décrit un historique : conserve-t-on l’ancienne version d’une voix après modification, peut-on la restaurer, sait-on quel fichier a été généré avec laquelle ? La facilité de génération multiplie ces décisions. Chaque ajustement crée une variante qu’il faudra pouvoir situer plus tard.

Une Maison pourrait tenir un registre simple : pour chaque voix, son type, son référent, les usages convenus, la date de chaque version, et les conditions du retrait d’une ancienne. C’est ce registre, tenu par la personne qui tranche, qui fera de la voix une voix de Maison.

LUXSURE LETTER

Le luxe, sélectionné plutôt que subi.

Recevez notre sélection éditoriale consacrée aux Maisons, aux idées et aux mutations qui façonnent le luxe contemporain.

RECEVOIR LUXSURE LETTER → DÉCOUVRIR LE MAGAZINE →

Related Articles