Le 24 septembre, Google a ajouté une présence vidéo à Gemini 3.8 Live dans son offre Enterprise. Pour l’hôtellerie, la question porte sur ce que ce visage animé a le droit de dire, de faire et de transmettre.
Un visage qui continue de parler pendant qu’il travaille
Dans l’annonce, signée par Shuo-yiin Chang et CJ Zheng au nom de l’équipe audio de Gemini, Google décrit une voix couplée à une vidéo générée quasi en temps réel. L’avatar écoute, regarde et répond avec des expressions et une synchronisation labiale. Il peut appeler des outils en arrière-plan sans interrompre la conversation. Google annonce aussi le passage entre 97 langues sans dégradation de l’image.
La seule scène d’hôtellerie du texte est une démonstration : l’enregistrement d’un client dans un hôtel, pendant que des outils travaillent en arrière-plan. C’est une vidéo de présentation, pas le retour d’un établissement qui l’utilise. L’annonce ne donne aucune mesure de délai, de précision ou de taux d’erreur.
Le visage donne du poids à la réponse
Un visage qui sourit et regarde rend un échange plus lisible. Il rend aussi une réponse erronée plus crédible. Un texte fautif à l’écran se lit avec méfiance. Le même contenu prononcé par une personne d’apparence attentive se contrôle moins volontiers. Ce jugement est celui de l’auteur, pas de Google, mais il justifie de traiter la question du mandat avant celle de l’apparence.
Transposons, sans décrire un cas réel. Un avatar lit une disponibilité et l’annonce au client, sans avoir le droit de la réserver. Un autre évoque un tarif ou une modification de séjour qu’il ne peut ni confirmer ni honorer. Dans les deux cas, la formulation doit dire ce qui est consulté, ce qui est promis et ce qui reste à valider par une personne. Un client ne fera pas cette différence tout seul devant un visage aussi fluide.
Ce que la transparence annoncée couvre
Google indique que toutes les sorties audio et vidéo portent le filigrane SynthID, qu’elle qualifie d’imperceptible. Sa fonction est de permettre de détecter, après coup, qu’un contenu est généré. Il n’informe pas l’invité, sur le moment, qu’il parle à une présence synthétique. Cette information relève de l’établissement, à qui il revient de la donner à l’écran ou à l’oral.
Google précise que la création d’un avatar personnalisé à partir d’une image de référence est réservée aux entreprises inscrites sur liste d’autorisation. La question du visage se pose alors : celui d’un employé, d’une personne réelle, ou d’un personnage inventé ? L’annonce ne traite pas des droits attachés à l’image de départ.
Ce que l’établissement devrait éprouver avant de l’ouvrir aux clients
L’évaluation porterait sur des échanges complets, y compris ceux où la réponse manque. Un avatar fluide qui retarde le contact avec la personne capable de trancher dégrade le service. Le passage de relais vers l’équipe est donc à tester au même titre que la qualité de l’image : à quel moment il se déclenche, ce qui est transmis, et si le client doit se répéter.
La cohérence visuelle aide une maison à se présenter. Mais la confiance dépend d’une cohérence que l’écran ne montre pas : chaque promesse faite par l’avatar doit correspondre à une donnée vérifiée et à une personne identifiable qui en répond.
