Cinely

ИИ-генератор видео со звуком, голосами и субтитрами: как избежать ошибок

Cinely Team··11 min
A studio microphone beside a glowing sound wave flowing into film frames

Вы наконец получили клип, который выглядит идеально, нажимаете play — и слышите тишину. Или слышите голос, но он принадлежит не тому персонажу, говорит на неправильном языке или отстаёт от движения губ на полсекунды.

Короткий ответ: многие инструменты для создания AI-видео до сих пор рендерят «немую» картинку и добавляют синтезированную озвучку отдельно, а более новые модели генерируют звук вместе с изображением, но сами решают, кто говорит и как. ИИ-генератор видео со звуком работает лучше всего, когда вы чётко указываете говорящих, пишете короткие реплики, которые вписываются в сцену, осознанно выбираете голоса и можете править субтитры.

Это руководство объясняет, почему возникают проблемы со звуком, что помогает их исправить в любом приложении, и как Cinely обрабатывает голоса, музыку и субтитры, включая ограничения.

Что не так со звуком в AI-видео, по отзывам

Мы проанализировали более 12 000 негативных отзывов на 63 приложения в App Store, Google Play, Trustpilot и Capterra. Проблемы со звуком встречались реже, чем жалобы на списание средств, обычно от 2 до 7% среди низкооценённых отзывов на видео-приложения и около 10% для инструментов с говорящими аватарами, таких как HeyGen и Synthesia. Но эти жалобы были одними из самых конкретных, и их можно разделить на пять категорий:

  • Полное отсутствие звука. Один рецензент Google Play для приложения HubX's AI Video писал, что клипы длятся около двух секунд и «в видео вообще нет звука». Пользователи Hailuo жаловались на клипы без аудио, голоса за кадром и субтитров. Пользователь Luma отмечал, что для добавления музыки приходится платить за другое ПО.
  • Неподходящие голоса. Рецензент на Trustpilot назвал озвучку Steve AI роботизированной и непригодной. Пользователи Synthesia говорили, что интонация иногда сбивается без возможности это исправить, а пользователи HeyGen — что клонированный голос на них не похож.
  • Задержки и рассинхрон. Пользователь Vidu заметил, что голос появляется уже после того, как рот пошевелился, а пользователи Hedra жаловались, что губы не попадают в такт при пении. Пользователь InVideo писал: «голоса были разными во всех клипах», а имя персонажа произносилось неправильно.
  • Не тот говорящий. Пользователь Sora в Google Play написал: «Диалог был перепутан между персонажами».
  • Не тот язык или ненужная речь. Рецензент Google Flow сказал, что приложение «полностью игнорирует инструкции на хинглише/хинди и навязывает английскую озвучку». Пользователь Runway получил китайские голоса, которых не запрашивал, а пользователь Kling просил, чтобы персонажи молчали, но они всё равно говорили.

Опыт может отличаться, и эти приложения часто обновляются, но тенденция сохраняется. Каждая неудача также стоит денег, потому что обычно приходится платить за новую генерацию. Это одна из причин, почему кредиты на AI-видео заканчиваются так быстро.

Почему во многих AI-видео нет звука?

Большинство моделей для создания AI-видео изначально создавались как системы только для картинки, а звук добавляется одним из двух способов.

Старый подход — рендеринг «немого» видео и отдельный этап добавления аудио. Классический ИИ-генератор видео с озвучкой сперва создаёт клип, затем преобразует ваш текст в речь с помощью текста в речь и накладывает его поверх, иногда добавляя фоновую музыку. Вы контролируете точные слова и можете дешёво поменять голос. Но анимация лица создавалась без учёта того, что он скажет, поэтому губы двигаются как попало, если только отдельная модель для синхронизации губ их не перерисует. Приложения, которые пропускают этап с аудио, просто выдают вам тихий клип.

Новый подход — нативный звук: модель генерирует картинку, речь, эффекты и фоновые звуки за один проход, исходя из вашего промпта. Губы и слова лучше совпадают, потому что они создаются вместе. Платой за это является контроль, потому что модель сама решает, кто говорит, как они звучат и иногда на каком языке. Каждый новый клип может использовать слегка отличающийся голос, и эти различия накапливаются в длинном фильме, поэтому планирование того, как создать длинное AI-видео, которое расскажет историю, так же важно, как и голос.

Что сравнить«Немое» видео плюс озвучкаНативный звук
Как создаётся звукДобавляется после рендеринга картинкиГенерируется вместе с картинкой за один проход
Обычно хорошо справляется сТочной формулировкой, выбранным вами голосом, дешёвыми переозвучкамиДвижением губ, соответствующим словам, фоновыми звуками и эффектами
Обычные проблемыГубы не совпадают, плоская подача, необходимость дополнительного этапа синхронизации губНе тот говорящий, голоса, меняющиеся между клипами, лишние или пропущенные реплики, смена языка

Как добиться естественных голосов и синхронизации губ?

Синхронизация губ в AI-видео чаще всего сбоит по простым, исправимым причинам: лицо слишком маленькое или отвернуто, или реплика слишком длинная для клипа. Эти привычки помогут в любом инструменте:

  1. Держите лицо говорящего в кадре. Средний план или крупный даёт модели рот для анимации. Общие планы с толпой, профили и затылки ухудшают синхронизацию.
  2. Соразмеряйте реплику с клипом. Люди произносят два-три слова в секунду, поэтому 8-секундный клип вмещает около 15 слов, с учётом пауз. Более длинные реплики будут произнесены торопливо или оборваны на полуслове.
  3. Указывайте, как произносится реплика. «Она шепчет», «он говорит со смехом» или «кричит сквозь шум дождя» даёт голосу что-то для игры. Без подсказки подача становится плоской.
  4. Подбирайте голос осознанно. Соотносите возраст, тембр и энергию с персонажем. Низкий голос у подростка будет восприниматься как ошибка дубляжа, даже если губы двигаются идеально.
  5. Тестируйте перед полным рендерингом. Сделайте один-два коротких клипа, послушайте в наушниках, а затем запускайте генерацию целиком.

Если имя постоянно произносится неправильно, может помочь его написание «как слышится». Субтитры, созданные из вашего сценария, будут отображать именно это написание, поэтому планируйте поправить дорожку с субтитрами. Подробнее о репликах, которые хорошо смотрятся на экране, читайте в этих советах по написанию диалогов для сцен в AI-фильмах.

Почему реплику произносит не тот персонаж?

Когда в кадре два человека, а в промпте написано «она говорит, я ухожу», модель должна угадать, кто такая «она». Модели с нативным звуком принимают это решение на основе текста и изображения. Если подсказки слабые, они выбирают лицо в центре или то, которое упомянуто первым, либо путают их. Втискивание диалога из нескольких реплик в один короткий клип усугубляет ситуацию, потому что модель также должна решить порядок.

Исправления — те же, что использовал бы супервайзер сценария:

  • Начинайте каждую реплику с новой строки и указывайте говорящего меткой, например МАРИЯ: «Ты взял билет?».
  • Опишите каждого говорящего один раз так, как его может увидеть камера, например «Мария, в жёлтом плаще», а затем используйте это же имя каждый раз. Избегайте местоимений, когда в кадре два персонажа.
  • Давайте каждому клипу максимум одну-две реплики, и если диалог длиннее, переносите ответ в следующий клип.
  • Делайте говорящего центром кадра: «Крупный план Марии, когда она спрашивает».

Если голос правильный, но лицо не соответствует тому, кого вы «пригласили на роль», это отдельная проблема со своими решениями, описанными в статье о том, почему AI-видео с вашим лицом может выглядеть странно.

Может ли AI-видео говорить на других языках, кроме английского?

Да, но английский — это язык, на который чаще всего «сбрасываются» модели, особенно при смешанных инструкциях. Рецензент Flow, упомянутый выше, писал на хинглише и получил английскую озвучку. Пользователи HeyGen и Fliki отмечали проблемы с хинди и маратхи, а пользователи Synthesia находили некоторые французские голоса роботизированными.

Несколько привычек сделают создание фильма на другом языке гораздо надёжнее:

  • Пишите сам диалог на целевом языке. Фраза «она говорит привет на хинди» просит модель перевести на лету; строка, написанная на хинди, не оставляет ничего для перевода.
  • Соблюдайте один язык на реплику. Переключение языка в середине предложения — это тот случай, когда голоса чаще всего возвращаются к английскому.
  • Если в инструменте есть языковая настройка, используйте её, а не полагайтесь только на промпт.
  • Слушайте имена и заимствованные слова в первом тестовом клипе — с ними проблемы возникают в первую очередь.

Cinely позволяет выбрать язык фильма или определить его автоматически; вот полный список языков, которые поддерживает Cinely.

Как добавить субтитры к AI-видео?

Субтитры выполняют две задачи: многие смотрят короткие видео без звука, а титры помогают уловить ошибки, которые можно пропустить на слух. Получить AI-видео с субтитрами можно тремя способами:

  • Из сценария. Слова точно соответствуют написанному вами, синхронизированы с речью.
  • С помощью распознавания речи. Инструмент слушает готовое аудио и транскрибирует его. Он улавливает то, что было сказано на самом деле, включая изменённые строки, но может неправильно расслышать имена.
  • Вшитые в видео или как отдельная дорожка. Вшитые субтитры — часть картинки, их нельзя исправить позже. Отдельную дорожку можно редактировать, отключать или переводить.

Какой бы способ вы ни выбрали, проверьте субтитры, сверив их с аудио, перед публикацией.

На что обратить внимание перед оплатой ИИ-генератора видео со звуком

Покупая кредиты, ответьте на эти вопросы с помощью тестового клипа и при включённом звуке:

  • Ваш тариф вообще генерирует звук или выдаёт тихий клип?
  • Можете ли вы прописывать точные реплики, или инструмент пишет свои?
  • Можете ли вы выбирать голос для каждого персонажа, и сколько разных голосов реально применяется в одной сцене?
  • Есть ли языковая настройка и покрывает ли она ваш язык?
  • Включены ли субтитры, можно ли их редактировать и бесплатны ли они?
  • Есть ли бесплатный превью или дешёвый короткий тест перед полным рендером?
  • Сколько стоит исправить одну неудачно произнесённую реплику и возвращаются ли кредиты за неудачные рендеры?

Любой ИИ-генератор видео с голосом должен отвечать на эти вопросы на страницах с тарифами или в справке. Если ответов нет, считайте, что перегенерации оплачиваете вы.

Как Cinely обрабатывает голоса, звук и субтитры?

Cinely — это создатель AI-фильмов, который превращает идею или сценарий в кино из 8-секундных сцен, доступный в веб-версии, на iOS и Android. Вот как работает звук, включая ограничения.

Диалоги. На вкладке «Идея» Cinely пишет историю и даёт каждой сцене одну или две реплики в большинстве жанров. На вкладке «Сценарий» он снимает именно то, что вы написали, сцена за сценой, и сохраняет ваш диалог слово в слово. В сцене без диалогов не будет речи. Если во всём сценарии нет реплик, фильм будет идти только с музыкой и звуками, если вы не разрешите ИИ добавить одну короткую реплику на сцену, описывающую то, что происходит.

Говорящие. Вкладка «Сценарий» формирует актёрский состав из меток говорящего вида ИМЯ: «реплика» и читает заголовки «Сцена 1:» или ИНТ./ЭКСТ. Бесплатная ИИ-проверка сценария отмечает темп для 8-секундных клипов, метки говорящих, заголовки и проблемы с правилами контента, ничего не меняя, пока вы не нажмёте «Применить».

Голоса. В бесплатном превью каждый персонаж получает голос из подборки, которую можно фильтровать по тембру, или голос в режиме «Авто», который подбирается автоматически. Честное ограничение: в тарифах «Стандарт» и «Про» применяется только выбранный вами голос первого персонажа; остальные персонажи озвучиваются моделью без вашего выбора. В тарифе «Кинематографичный» создаётся состав из одного-трёх персонажей как активов, которые сохраняют лицо и голос каждого персонажа. «Кинематографичный» стоит 60 кредитов за сцену вместо 30, а в веб-версии для него требуется Cinely Premium.

Звук и музыка. Отдельной музыкальной дорожки или наложенной озвучки нет. Звук и музыка создаются аудиомоделью самого видео, и явные подсказки об инструментальной музыке пишутся только для сцен в стиле немого кино или без диалогов.

Язык и субтитры. Истории можно генерировать на 17 языках, или язык может определяться автоматически. Сценарий из вкладки «Сценарий» переводится на выбранный вами язык фильма, поэтому выбирайте язык, на котором написаны ваши реплики, если хотите, чтобы они звучали дословно. «Авто-субтитры» — это переключатель, по умолчанию выключенный. Когда фильм завершён, субтитры бесплатно генерируются на всех 17 языках, и вы можете редактировать дорожки в редакторе.

Стоимость и исправления. Вы платите только за сцены, которые одобряете в превью: 30 кредитов за сцену в «Стандарте». За неудавшиеся сцены кредиты возвращаются автоматически. За сцену, которая отрендерилась, но где реплика была произнесена неудачно, возврата нет, а исправление её в редакторе стоит фиксированных 60 кредитов. Защитный фильтр также может блокировать озвученные диалоги самостоятельно; если это произошло, читайте статью о том, почему ИИ блокирует безобидные на вид промпты.

Пошагово: короткий фильм с голосами в Cinely

  1. Откройте страницу создания Cinely и выберите вкладку «Сценарий». Если вы вставите сценарий на вкладке «Идея», Cinely предложит перенести его.
  2. Напишите по одному заголовку на сцену и одну-две коротких реплики с метками под каждым:
    Сцена 1: Затопленная дождём автобусная остановка ночью
    МАРИЯ: «Ты сохранил билет?»
    ЛЁША: «Я сохранил всё.»
    
  3. Запустите бесплатную ИИ-проверку сценария и примените только те предложения, с которыми согласны.
  4. Выберите язык фильма или оставьте автоопределение и включите «Авто-субтитры», если они нужны.
  5. Оставьте включённым «Превью перед генерацией». В превью проверьте, кто появляется в каждой сцене, и подберите голоса, помня, что «Стандарт» и «Про» применяют только голос первого персонажа.
  6. Начните с фильма из 2 сцен: 16 секунд за 60 кредитов «Стандарта». Прослушайте, кто говорит, на каком языке и в каком темпе. Бесплатные аккаунты по умолчанию могут создавать фильмы до 6 сцен (48 секунд).
  7. Когда полный фильм будет готов, откройте редактор и проверьте дорожки субтитров, сверив их с аудио.

Звук — это то, что превращает AI-клип в настоящую сцену. Пишите короткие реплики с метками, выбирайте голоса осознанно, оставляйте субтитры включёнными для всего, что публикуете, и сначала тестируйте короткий отрывок. Когда будете готовы, напишите свою первую сцену с диалогом: превью бесплатно, и вы просматриваете каждую сцену и голос, прежде чем будут потрачены кредиты.

Почему во многих AI-видео вообще нет звука?
Многие инструменты сперва рендерят «немое» видео, а затем накладывают озвучку текста в речь. Если этап с аудио пропускают, вы получаете тихий клип. Новые модели генерируют звук вместе с картинкой, но сами решают, кто говорит и как.
Как добиться естественных голосов и синхронизации губ?
Убедитесь, что лицо говорящего хорошо видно (крупный или средний план), пишите короткие реплики (до 15 слов на 8-секундную сцену), указывайте манеру речи («шепотом», «со смехом») и подбирайте голос, подходящий персонажу по возрасту и энергии.
Почему реплику произносит не тот персонаж?
Если в кадре два человека, а в промпте указано «она говорит», модель угадывает, кто «она». Чтобы этого избежать, указывайте говорящего в каждой реплике меткой, например МАРИЯ: «Ты взял зонт?». Избегайте местоимений, если в кадре несколько персонажей.
Можно ли создавать видео на других языках, кроме английского?
Да, но модели часто «сбрасываются» на английский, особенно при смешанных инструкциях. Пишите диалоги сразу на целевом языке, не переключайте язык внутри реплики и используйте языковые настройки инструмента, если они есть. Cinely поддерживает генерацию на 17 языках.
Как добавить субтитры к AI-видео?
Субтитры можно получить из вашего сценария (слова точно соответствуют написанному), с помощью распознавания речи (переводится сказанное в видео, но могут быть ошибки в именах) или как отдельную дорожку, которую можно править. В Cinely субтитры генерируются бесплатно в 17 языках.

Written with AI assistance and edited by the Cinely Team.