Lorsqu'on génère des vidéos par IA, avec des personnages qui parlent, un des problèmes rencontrés est le bon maintien de la même texture de voix d'une vidéo à l'autre.
Comment faire pour garder la même voix sur l'ensemble de la production ? Le doublage post-prod est souvent la seule méthode, mais il faut alors trouver sa voix.
Nous poursuivons notre étude de génération d'images, vidéos et musique par IA générative gratuites dans le cadre du projet #OndineWatts.
Aujourd'hui, nous nous intéressons donc à la voix.
Démonstration par l'exemple, tout est parti de l'idée de réaliser une nouvelle vidéo, où l'on offre des cadeaux à Ondine Watts,
et pile à ce moment là, voici que Grok-Imagine se met à bloquer la génération de vidéos gratuites !
Et les séquences déjà générée possèdent des voix disparates, qui ne peuvent être raisonnablement pas être utilisées telles qu'elles.
A chaque problème, sa solution : c'est l'occasion de nous lancer dans la réalisation du doublage de la vidéo, toujours par IA.
La vidéo prévue est un intervenant masculin situé hors-champ qui offre des objets-cadeaux à Ondine.
Vu que c'est surtout sa voix à lui qui pose un problème de cohérence, je me dis que je vais moi-même doubler ses interventions,
sauf qu'il me reste des scènes à générer et à monter, scènes où je n'ai pas de voix pour Ondine.
Ne me sentant pas en mesure de l'imiter (!), il faut donc que je génère une nouvelle voix pour elle, à monter sur la vidéo globale.
Alors, si je le fais pour elle, autant le faire aussi pour l'intervenant qui se cache derrière sa moustache (si, si, il a une moustache !).
Génération de voix à la demande
De nombreux sites permettent de générer des voix, mais elles sont souvent un peu robotiques: ce sont des systèmes de synthèse vocale, et non des voix générées par IA.
Et d'ailleurs, après bien des difficultés pour lui faire générer ce que je cherchais, l'IA Gemini-Canva va me proposer à un moment, la solution de la synthèse vocale,
celle des ordinateurs que vous et moi, utilisons: PC sous Windows, Mac... mais aussi sous Android. Je ne suis pas certains que cela fonctionne sur d'autres plateformes.
Je vous laisse tester le résultat ci-dessous, et si cela fonctionne, vous régaler du jeux d'acteur (!).
Avec un peu de chance, en fonction de ce qu'il y a d'installé sur votre plateforme (ordi PC, Mac, versions diverses de Windows, tablette, téléphone...),
vous aurez même le droit de choisir une autre voix. De mon coté, sur Windows 11, j'ai le plus de choix de voix et d'accents avec Microsoft Edge (16 voix différentes).
Lecteur Vocal Avancé
1.0
1.0
Note : Le réalisme dépend des voix installées sur votre système.
La photo change selon le genre de la voix choisi.
Alors, oui, si le script fonctionne chez vous et si vous avez un système de synthèse vocale actif sur votre système d'exploitation,
vous pouvez taper ce que vous désirez et cela sera dit a haute voix. Cool, hein ?
Oui mais... reconnaissons que cela manque cruellement de naturel !
Ne connaissant pas d'acteurs sans boulot autour de moi, une voix générée par IA, sera plus "vivante".
Malheureusement l'appel de certaines API Google est un peu compliqué sans un compte dûment identifié qui possède les bons droits.
Alors il est hélas impossible de réaliser sur cette page, d'une manière fiable, la même petite fenêtre que ci-dessus,
mais avec des voix en IA, tout en vous laissant la possibilité de modifier le contenu de l'entretien. Les IA sont d'un triste... !
Vous pouvez cependant tout de même utiliser le lecteur situé en dessous.
Oui, malgré ce qui a été demandé à Gemini-Canva, vous n'êtes pas sourds: l'entretien n'est pas vraiment "croisé", car les deux intervenants ont la même voix !
Je lui ferai finalement générer les deux versions (masculine / féminine) séparément, et je découperai avec Audacity, les sections désirées afin de les monter dans la vidéo finale.
Fun fact: si Gemini peine (encore) un peu pour la génération de voix, il suffit de rajouter "Chanson" ou "Musique" dans le prompt, pour l'entendre générer des trucs farfelus
(on va qualifier cela de "Jingles") de moins de 30 secondes, où notre texte est interprété sous forme de chanson... !
Il faut avouer que c'est un peu contre intuitif de découvrir qu'il est plus facile pour une IA de chanter que de parler.
Time-line du montage vidéo au format short
Visitez aussi le site https://luvvoice.com, qui permet notamment de faire du clonage de voix, même si, en version gratuite, c'est assez limité.
Je vous laisse regarder la vidéo où j'explique tout ce qui a été écrit ici, et un peu plus encore, avec même la mini-séquence montée à la fin...
Vidéo doublage par IA - Trouver sa voix
Accéder à la playlist Youtube #OndineWatts
Profitons de cette page pour annoncer la création d'un profil Ondine-Watts sur SoundCloud. Ses titres y seront ajoutés au fur et à mesure: