Cinely

Générateur de vidéos IA avec son, voix et sous-titres

Cinely Team··14 min
A studio microphone beside a glowing sound wave flowing into film frames

Le clip est bon, vous lancez la lecture… et c'est le silence. Ou bien une voix passe, mais elle n'appartient pas au bon personnage, elle est en anglais alors que vous aviez demandé du français, ou elle arrive avec un demi-retard sur les lèvres.

La raison : beaucoup d'outils de vidéo IA produisent d'abord une image muette à laquelle ils ajoutent une voix de synthèse après coup. Les modèles plus récents génèrent le son en même temps que l'image, mais décident parfois eux-mêmes qui parle et comment. Pour un résultat optimal, il faut leur donner des lignes de dialogue clairement attribuées, des répliques courtes, des voix choisies délibérément, et des sous-titres que vous pouvez corriger.

Ce guide explique pourquoi le son dérape, comment y remédier dans n'importe quelle application, et comment Cinely gère les voix, la musique et les sous-titres.

Ce que les avis révèlent sur les problèmes sonores des vidéos IA

Fin 2026, nous avons analysé plus de 12 000 avis négatifs (1 ou 2 étoiles) de 63 applications sur l'App Store, Google Play, Trustpilot et Capterra. Les problèmes de son représentaient une part moindre que les litiges liés aux paiements, généralement 2 à 7 % des avis négatifs pour les apps vidéo, et jusqu'à un sur dix pour les outils d'avatars parlants comme HeyGen et Synthesia. Mais ces critiques étaient parmi les plus précises, et elles se répartissent en cinq catégories :

  • Absence totale de son. Un utilisateur de l'app « HubX AI Video » sur Google Play notait que les clips duraient environ deux secondes et que « la vidéo n'a absolument aucun son ». Des utilisateurs de Hailuo signalaient des clips sans audio, sans narrateur et sans sous-titres. Un utilisateur de Luma remarquait qu'il fallait payer un autre logiciel juste pour ajouter de la musique.
  • Voices qui sonnent faux. Un utilisateur sur Trustpilot qualifiait les voix de Steve IA de « robotiques et inutilisables ». Des utilisateurs de Synthesia disaient que l'intonation était parfois décalée, sans possibilité de la corriger. Des utilisateurs de HeyGen estimaient que leur clone vocal ne leur ressemblait pas du tout.
  • Voices qui dérivent ou accusent un décalage. Un utilisateur de Vidu remarquait que la voix arrivait après le mouvement des lèvres. Des utilisateurs de Hedra signalaient que la synchronisation labiale sur les chansons était ratée. Un utilisateur d'InVideo constatait que « les voix étaient toutes différentes dans tous les clips », et que le nom de son personnage était mal prononcé.
  • Le mauvais personnage parle. Un utilisateur de Sora sur Google Play écrivait : « Les dialogues étaient inversés entre les personnages. »
  • La mauvaise langue, ou des paroles non sollicitées. Un utilisateur de Google Flow disait que l'app « ignore complètement les instructions en Hinglish/Hindi et impose un doublage en anglais ». Un utilisateur de Runway obtenait des voix en chinois qu'il n'avait jamais demandées. Un utilisateur de Kling, ayant spécifié « aucun dialogue », se retrouvait avec des personnages qui parlaient malgré tout.

Les expériences varient et ces apps évoluent vite, mais le schéma est constant. Chaque échec a aussi un coût, car la solution habituelle est une nouvelle génération, souvent payante. C'est l'une des raisons pour lesquelles les crédits pour les vidéos IA s'épuisent si vite.

Pourquoi tant de vidéos IA n'ont-elles pas de son ?

La plupart des modèles de vidéo IA ont commencé comme des systèmes uniquement visuels, et les outils ajoutent le son de l'une de ces deux façons.

La méthode plus ancienne consiste en un rendu silencieux suivi d'une étape audio séparée. Un générateur classique produit d'abord le clip muet, puis lit votre texte avec une voix de synthèse et la superpose, parfois sur un fond musical prédéfini. Vous contrôlez les mots exacts et pouvez changer de voix à moindre coût. Mais le visage a été animé sans savoir ce qu'il allait dire, donc les bouches bougent au hasard, à moins qu'un modèle de synchronisation labiale ne les redessine. Les apps qui sautent l'étape audio vous livrent simplement un clip silencieux.

La méthode plus récente est l'audio natif : le modèle génère l'image, la parole, les effets et l'ambiance sonore en une seule passe à partir de votre prompt. Les lèvres et les mots sont mieux synchronisés car ils sont créés ensemble. Le compromis se fait sur le contrôle, car le modèle décide qui parle, comment il sonne et parfois dans quelle langue. Chaque nouveau clip peut utiliser une voix légèrement différente, et cette dérive s'accumule sur un film long, ce qui explique pourquoi la planification dans le guide sur comment faire une longue vidéo IA qui raconte une histoire est aussi importante que le choix de la voix.

Critère de comparaisonVidéo muette + doublageAudio natif
Méthode de création du sonAjouté après le rendu de l'imageGénéré en même temps que l'image
Points forts habituelsMots exacts, voix choisie, refaire l'audio à moindre coûtSynchronisation labiale, son d'ambiance et effets cohérents
Problèmes habituelsLèvres désynchronisées, intonation plate, étape de lip-sync supplémentaireMauvais locuteur, voix qui changent entre les clips, lignes en trop ou manquantes, changement de langue

Comment obtenir des voix naturelles et une bonne synchronisation labiale ?

La synchro labiale en vidéo IA échoue le plus souvent pour des raisons simples et corrigeables : le visage est trop petit ou de profil, ou la réplique est trop longue pour la durée du clip. Ces habitudes aident dans n'importe quel outil :

  1. Gardez le visage du locuteur bien visible. Un plan moyen ou un gros plan donne au modèle une bouche à animer. Les plans larges sur une foule, les profils ou les dos nuisent à la synchronisation.
  2. Ajustez la réplique à la durée du clip. On prononce deux à trois mots par seconde. Un clip de 8 secondes peut contenir environ 15 mots en laissant de l'espace pour respirer. Les répliques plus longues sont bâclées ou coupées en plein mot.
  3. Précisez l'intention de la réplique. Des indications comme « elle murmure », « il ricane en disant » ou « crie sous la pluie » donnent une intention à la voix. Sans indication, l'intonation est souvent plate.
  4. Choisissez la voix intentionnellement. Faites correspondre l'âge, le timbre et l'énergie au personnage. Une voix grave sur un adolescent passe pour une erreur de doublage, même si les lèvres sont parfaitement synchronisées.
  5. Testez avant le rendu final. Faites un ou deux clips courts, écoutez au casque, puis lancez-vous.

Si un nom est systématiquement mal prononcé, l'écrire phonétiquement peut aider. Les sous-titres générés à partir de votre script refléteront cette orthographe, prévoyez donc de corriger la piste de sous-titres. Pour plus de conseils sur l'écriture, consultez ces astuces pour écrire des dialogues dans les scènes de films IA.

Pourquoi le mauvais personnage prononce-t-il la réplique ?

Quand deux personnages partagent un plan et que le prompt indique « elle dit : je m'en vais », le modèle doit deviner qui est « elle ». Les modèles à audio natif prennent cette décision à partir du texte et de l'image. Quand les indices sont faibles, ils choisissent le visage le plus central ou le premier mentionné, ou ils inversent. Entasser un échange en une seule courte scène empire la situation, car le modèle doit aussi décider de l'ordre des répliques.

Les solutions sont celles qu'utiliserait un scripte :

  • Placez chaque réplique sur sa propre ligne avec une étiquette de locuteur, comme MAYA : « Tu as gardé le billet ? ».
  • Décrivez chaque locuteur une fois, d'une manière visible à l'écran, par exemple « Maya, en imperméable jaune », puis utilisez toujours le même nom. Évitez les pronoms quand deux personnages partagent un plan.
  • Limitez chaque clip à une ou deux répliques maximum, et passez la réponse au clip suivant si l'échange est plus long.
  • Faites du locuteur le sujet du plan : « Gros plan sur Maya alors qu'elle demande. »

Si la voix est bonne mais que le visage ne correspond pas au personnage que vous avez « casté », c'est un problème différent avec ses propres solutions, abordé dans pourquoi une vidéo IA avec votre visage peut sembler bizarre.

Une vidéo IA peut-elle parler d'autres langues que l'anglais ?

Oui, mais l'anglais reste la langue de repli de la plupart des modèles, et des instructions mélangées les y poussent. L'utilisateur de Flow mentionné plus haut avait écrit en Hinglish et a obtenu un doublage en anglais. Des utilisateurs de HeyGen et Fliki ont signalé des problèmes avec l'hindi et le marathi, et des utilisateurs de Synthesia trouvaient certaines voix françaises robotiques.

Quelques habitudes rendent un film dans une autre langue bien plus fiable :

  • Écrivez le dialogue lui-même dans la langue cible. « Elle dit bonjour en hindi » demande au modèle de traduire à la volée ; une ligne écrite en hindi ne laisse rien à traduire.
  • Gardez une seule langue par réplique. Changer de langue en milieu de phrase est le moment où les voix retombent le plus souvent en anglais.
  • Si l'outil a un paramètre de langue, utilisez-le plutôt que de vous fier uniquement au prompt.
  • Écoutez attentivement les noms propres et les mots empruntés dans votre premier clip test, car ce sont eux qui dérapent en premier.

Cinely vous permet de choisir la langue du film ou de la détecter automatiquement ; voici la liste complète des langues prises en charge par Cinely.

Comment ajouter des sous-titres à une vidéo IA ?

Les sous-titres ont deux fonctions : beaucoup de gens regardent les vidéos courtes en mode muet, et les légendes captent les erreurs que vos oreilles peuvent manquer. Vous pouvez obtenir une vidéo IA avec sous-titres de trois manières :

  • À partir du script. Les mots sont exactement ceux que vous avez écrits, calés sur la parole.
  • Par reconnaissance vocale. Un outil écoute l'audio final et le retranscrit. Il capture ce qui a été réellement dit (y compris les lignes modifiées), mais peut mal entendre les noms.
  • Incrustés ou en piste séparée. Les sous-titres « brûlés » font partie de l'image et ne peuvent pas être corrigés ultérieurement. Une piste séparée peut être éditée, masquée ou traduite.

Quelle que soit la méthode, relisez toujours les sous-titres en les comparant à l'audio avant de publier.

Que vérifier avant de payer pour un générateur de vidéos IA avec son ?

Avant d'acheter des crédits, testez ces points avec un clip d'exemple et le volume monté :

  • Votre forfait produit-il du son, ou un clip muet ?
  • Pouvez-vous écrire les répliques exactes, ou l'outil écrit-il les siennes ?
  • Pouvez-vous choisir une voix par personnage, et combien de voix différentes sont réellement appliquées dans une scène ?
  • Y a-t-il un paramètre de langue, et couvre-t-il votre langue ?
  • Les sous-titres sont-ils inclus, modifiables et gratuits ?
  • Y a-t-il un aperçu gratuit ou un test court et peu coûteux avant le rendu complet ?
  • Quel est le coût pour corriger une réplique mal livrée, et les rendus ratés sont-ils remboursés ?

Tout générateur de vidéos IA avec voix devrait répondre à ces questions sur ses pages tarifaires ou d'aide. Si ce n'est pas le cas, partez du principe que les nouvelles tentatives seront à votre charge.

Comment Cinely, le créateur de films IA, gère-t-il les voix, le son et les sous-titres ?

Cinely est un créateur de films IA qui transforme une idée ou un scénario en un film composé de scènes de 8 secondes, disponible sur le web, iOS et Android. Voici comment fonctionne le son, limites incluses.

Dialogue. Sur l'onglet Idée, Cinely écrit l'histoire et donne à chaque scène une ou deux répliques parlées dans la plupart des genres. Sur l'onglet Scénario, il filme exactement ce que vous avez écrit, scène par scène, et conserve votre dialogue mot pour mot. Une scène sans dialogue n'aura pas de parole. Si tout le scénario est sans dialogue, le film jouera avec uniquement de la musique et du son, sauf si vous autorisez l'IA à ajouter une courte ligne par scène décrivant ce qui est montré.

Locuteurs. L'onglet Scénario construit votre casting à partir des étiquettes de locuteurs du type NOM : « réplique » et tient compte des intitulés « Scène 1 : » ou INT./EXT. Une vérification gratuite par IA signale les problèmes de rythme pour les scènes de 8 secondes, les étiquettes de locuteurs, les intitulés et les problèmes liés aux règles de contenu, et ne change rien à moins que vous ne tapiez Appliquer.

Voix. Dans l'aperçu gratuit, chaque personnage se voit attribuer une voix via un sélecteur que vous pouvez filtrer par timbre, ou via le mode Auto, qui choisit une voix appropriée. La limite à connaître : avec les formules Standard et Pro, seul le premier personnage se voit appliquer la voix que vous avez choisie ; les autres locuteurs sont doublés par le modèle sans que vous puissiez choisir leur voix. Avec Cinematic, un casting de un à trois personnages est créé sous forme d'« assets » qui conservent le visage et la voix propres à chaque personnage. Cinematic coûte 60 crédits par scène au lieu de 30, et nécessite Cinely Premium sur le web.

Son et musique. Il n'y a pas de piste musicale séparée ni de doublage ajouté après coup. Le son et la musique proviennent de l'audio natif généré par le modèle vidéo, et les indications de musique instrumentale explicite ne sont écrites que pour les scènes de film muet ou sans dialogue.

Langue et sous-titres. Les histoires peuvent être générées en 17 langues, ou la langue peut être détectée automatiquement. Un scénario dans l'onglet Scénario est traduit dans la langue du film que vous choisissez, donc sélectionnez la langue dans laquelle vos répliques sont écrites si vous voulez qu'elles soient conservées mot pour mot. Le mode « Sous-titres auto » est un interrupteur, désactivé par défaut. Une fois le film terminé, des sous-titres sont générés dans les 17 langues sans coût supplémentaire, et vous pouvez éditer les pistes dans l'éditeur.

Coûts et corrections. Vous ne payez que lorsque vous approuvez l'aperçu, pour les scènes affichées : 30 crédits par scène Standard. Les scènes qui échouent à se générer sont remboursées automatiquement. Une scène qui s'est générée mais qui a livré une réplique de manière incorrecte n'est pas remboursée, et la corriger dans l'éditeur coûte 60 crédits forfaitaires. Le filtre de sécurité peut aussi bloquer des dialogues parlés de lui-même ; si cela arrive, lisez pourquoi l'IA bloque des prompts qui semblent inoffensifs.

Pas à pas : réaliser un court métrage avec voix sur Cinely

  1. Ouvrez la page de création Cinely et choisissez l'onglet Scénario. Si vous collez un scénario dans l'onglet Idée, Cinely vous proposera de le déplacer.
  2. Écrivez un intitulé par scène et une ou deux répliques courtes avec étiquette en dessous :
Scène 1 : Un arrêt de bus sous la pluie, la nuit
MAYA : « Tu as gardé le billet ? »
LEO : « J'ai tout gardé. »
  1. Lancez la vérification gratuite du scénario par IA et n'appliquez que les suggestions avec lesquelles vous êtes d'accord.
  2. Choisissez la langue du film ou laissez la détection automatique, et activez les « Sous-titres auto » si vous le souhaitez.
  3. Gardez « Aperçu avant génération » activé. Dans l'aperçu, vérifiez qui apparaît dans chaque scène et choisissez les voix, en gardant à l'esprit que Standard et Pro n'appliquent que la voix du premier personnage.
  4. Commencez par un film de 2 scènes : 16 secondes pour 60 crédits Standard. Vérifiez le locuteur, la langue et le timing. Les comptes gratuits peuvent par défaut faire des films jusqu'à 6 scènes (48 secondes).
  5. Une fois le film complet généré, ouvrez l'éditeur et relisez les pistes de sous-titres en les comparant à l'audio.

C'est avec le son qu'un clip IA commence à ressembler à une vraie scène. Écrivez des répliques courtes et bien attribuées, choisissez les voix intentionnellement, activez les sous-titres pour toute publication, et testez d'abord avec une version courte. Quand vous êtes prêt, écrivez votre première scène avec dialogue : l'aperçu est gratuit, et vous validez chaque scène et chaque voix avant qu'aucun crédit ne soit dépensé.

Pourquoi tant de vidéos IA n'ont-elles aucun son ?
De nombreux outils débutaient par la génération d'image uniquement, et ajoutent le son après coup. La vidéo est rendue silencieuse, puis une voix de synthèse est superposée, parfois avec un fond musical. Sans cette étape audio, le clip reste muet. Les modèles plus récents génèrent l'image et le son simultanément, ce qui améliore la synchronisation labiale mais réduit parfois votre contrôle sur la voix.
Comment obtenir des voix naturelles et une bonne synchro labiale ?
Priorisez les plans rapprochés sur le visage du personnage qui parle. Écrivez des répliques courtes (environ 15 mots max pour une scène de 8 secondes). Précisez l'intention (ex: « murmure », « ricane en disant »). Choisissez une voix qui correspond à l'âge et à l'énergie du personnage. Testez toujours avec un clip court en premier.
Comment s'assurer que c'est le bon personnage qui parle ?
Évitez les pronoms ambigus. Étiquetez chaque réplique avec le nom du personnage (ex: MAYA: « Tu as gardé le billet ? »). Décrivez chaque locuteur clairement au début. Limitez-vous à une ou deux répliques par scène, et passez à une nouvelle scène pour la réplique suivante.
Peut-on générer des vidéos dans d'autres langues que l'anglais ?
Oui, mais l'anglais reste la langue de repli des modèles. Pour un résultat fiable, écrivez le dialogue directement dans la langue cible. Évitez les mélanges de langues dans une même phrase. Si l'outil propose un paramètre de langue, utilisez-le. Testez toujours les noms propres et les mots empruntés.
Comment ajouter des sous-titres à une vidéo IA ?
Ils peuvent être générés à partir du script original (mots exacts) ou par reconnaissance vocale sur l'audio final. Vérifiez toujours les sous-titres contre l'audio avant publication. Préférez les pistes de sous-titres séparées et modifiables aux sous-titres « brûlés » dans l'image.
Comment Cinely gère-t-il les voix, le son et les sous-titres ?
Cinely crée des films à partir d'un scénario. Sur l'onglet Script, il suit vos répliques mot pour mot. Vous choisissez une voix pour le premier personnage (formules Standard et Pro) ou une voix propre pour chaque personnage avec Cinematic. Le son et la musique sont générés par le modèle vidéo. Les sous-titres peuvent être générés automatiquement et édités après rendu.

Written with AI assistance and edited by the Cinely Team.