AI가 만드는 동영상에 소리와 음성, 자막을 더하는 방법

마음에 드는 영상을 만들었는데 재생해 보니 아무 소리가 안 들립니다. 아니면 음성이 나오긴 하는데, 다른 캐릭터 목소리가 나오거나, 말투가 어색하거나, 입모양보다 반 박자 늦게 들리기도 하죠.
간단히 말하면, 많은 AI 동영상 도구는 여전히 무음 영상을 먼저 만들고 나중에 텍스트 음성 변환 목소리를 얹는 반면, 더 새로운 모델은 영상과 소리를 한꺼번에 생성하지만 누가 어떤 말을 할지는 스스로 결정합니다. 소리가 있는 AI 동영상 생성기는 화자 레이블을 명확히 하고, 장면 길이에 맞는 짧은 대사를 쓰며, 의도적으로 선택한 음성과 수정 가능한 자막을 함께 사용할 때 가장 좋은 결과를 냅니다.
이 가이드에서는 AI 동영상의 소리가 왜 문제가 생기는지, 어떤 앱에서든 이를 해결하는 방법은 무엇인지, 그리고 Cinely가 음성, 음악, 자막을 어떻게 다루는지(그 한계까지 포함해서) 설명하겠습니다.
리뷰어들이 지적하는 AI 동영상 소리의 문제점
우리는 2026년 9월, App Store, Google Play, Trustpilot, Capterra에 있는 63개 앱의 별점 12개 리뷰 12,000건 이상을 분석했습니다. 소리 문제는 결제나 크레딧 관련 불만보다는 비중이 적었지만(대개 비디오 앱의 낮은 별점 리뷰 중 27%, HeyGen이나 Synthesia 같은 말하는 아바타 도구에선 10%에 가까웠음), 가장 구체적인 불만 중 하나였고, 다섯 가지 패턴으로 나뉩니다:
- 소리가 전혀 없음. HubX AI Video 앱의 한 Google Play 리뷰어는 클립이 2초 정도밖에 안 되고 「동영상에 소리가 전혀 없어요」라고 말했습니다. Hailuo 사용자들도 오디오나 나레이션, 자막이 없는 클립을 보고했고, Luma 사용자는 음악을 추가하려면 다른 소프트웨어를 또 사야 한다고 했습니다.
- 음성이 이상하게 들림. Trustpilot 리뷰어는 Steve AI의 더빙을 로봇 같아 쓸 수 없다고 표현했습니다. Synthesia 리뷰어들은 강세가 이상하게 들어가는데 고칠 방법이 없다고 했고, HeyGen 사용자들은 자신의 목소리 클론이 전혀 본인 같지 않다고 했습니다.
- 음성이 뒤늦게 나오거나 지연됨. Vidu 리뷰어는 입이 움직인 후에야 음성이 나오는 걸 발견했고, Hedra 사용자들은 노래하는 입모양 동기화가 안 맞는다고 말했습니다. InVideo 사용자는 「클립마다 목소리가 모두 달랐고」, 캐릭터 이름 발음도 틀렸다고 지적했습니다.
- 대사가 다른 캐릭터가 말함. Google Play의 한 Sora 사용자는 「대사가 캐릭터들 사이에서 뒤바뀌었습니다」라고 썼습니다.
- 다른 언어가 나오거나, 요청하지 않은 말이 나옴. Google Flow 리뷰어는 앱이 「힌글리시/힌디어 지시를 완전히 무시하고 영어 더빙을 강제한다」고 말했습니다. Runway 사용자는 요청하지 않은 중국어 음성을 받았고, Kling 사용자는 말을 원하지 않았는데도 캐릭터들이 말을 하게 만들었다고 합니다.
경험은 다양하고 이 앱들은 자주 바뀌지만, 패턴은 일관됩니다. 이런 실패는 돈이 더 든다는 문제도 있습니다. 왜냐하면 일반적인 해결책은 또 다른 유료 생성이기 때문이죠. 이것이 AI 동영상 크레딧이 너무 빨리 바닥나는 이유 중 하나입니다.
왜 이렇게 많은 AI 동영상에 소리가 없을까?
대부분의 AI 동영상 모델은 이미지만 생성하는 시스템으로 시작했고, 도구들은 소리를 다음 두 가지 방법 중 하나로 덧붙입니다.
오래된 방식은 무음 렌더링에 별도의 오디오 단계를 추가하는 겁니다. 음성이 있는 전형적인 AI 동영상 생성기는 클립을 렌더링한 후, 텍스트 음성 변환 음성으로 여러분의 텍스트를 읽어 그 위에 얹습니다. 때로는 스톡 음악도 같이 넣죠. 정확한 단어를 통제할 수 있고, 음성은 저렴하게 바꿀 수 있습니다. 하지만 얼굴 애니메이션은 무슨 말을 할지 모른 채 만들어졌기 때문에, 별도의 입모양 동기화 모델이 입을 다시 그리지 않는 한 입은 무작위로 움직입니다. 오디오 단계를 생략하는 앱들은 그냥 무음 클립을 여러분에게 넘겨줄 뿐입니다.
새로운 방식은 네이티브 오디오입니다. 모델이 여러분의 프롬프트로부터 영상, 말, 효과음, 배경음을 한 번에 생성하는 거죠. 입과 단어가 함께 만들어지기 때문에 더 잘 맞습니다. 하지만 그 대신 통제력을 잃게 됩니다. 누가 말할지, 어떻게 들릴지, 때로는 어떤 언어를 쓸지 모델이 결정하기 때문이에요. 새로운 클립마다 약간 다른 음성이 나올 수 있고, 긴 영화에서는 이런 차이가 누적됩니다. 스토리가 있는 긴 AI 동영상을 만드는 방법에서 계획이 음성만큼 중요한 이유도 여기에 있습니다.
| 비교 항목 | 무음 영상 + 더빙 | 네이티브 오디오 |
|---|---|---|
| 소리가 만들어지는 방식 | 영상 렌더링 후 추가됨 | 영상과 함께 한 번에 생성됨 |
| 일반적으로 잘하는 점 | 정확한 단어, 선택한 음성, 저렴한 오디오 재촬영 | 단어에 맞는 입모양, 배경음 및 효과음 |
| 일반적으로 문제되는 점 | 입모양이 맞지 않음, 평면적인 표현, 추가 입모양 동기화 단계 필요 | 잘못된 화자, 클립마다 변하는 음성, 추가되거나 빠진 대사, 언어 변경 |
자연스러운 음성과 맞는 입모양 동기화는 어떻게 얻나요?
AI 동영상 입모양 동기화 실패는 단순하고 고칠 수 있는 이유에서 가장 많이 발생합니다. 얼굴이 너무 작거나 돌아가 있어서, 아니면 클립 길이에 비해 대사가 너무 길어서죠. 어떤 도구를 쓰든 도움이 되는 습관들입니다:
- 화자의 얼굴이 보이도록 하세요. 중간 샷이나 클로즈업은 모델이 애니메이션할 입을 제공합니다. 넓은 군중 샷, 프로필, 뒷머리는 동기화를 더 나쁘게 만듭니다.
- 대사를 클립 길이에 맞추세요. 사람들은 초당 2~3단어 정도 말하므로, 8초 클립은 숨 쉴 틈을 감안해 약 15단어를 담을 수 있습니다. 더 긴 대사는 급하게 말하거나 중간에 끊깁니다.
- 대사가 어떻게 전달되는지 말해주세요. 「그녀가 속삭이며」, 「그가 웃으면서 말하며」 또는 「빗속에서 소리치며」처럼 연기할 단서를 주세요. 지시가 없으면 표현이 평면적으로 됩니다.
- 의도적으로 음성을 선택하세요. 나이, 음높이, 에너지를 캐릭터에 맞추세요. 십대에게 낮은 목소리를 쓰면 입모양이 완벽해도 더빙 실수처럼 들립니다.
- 본격 렌더링 전에 테스트하세요. 한두 개의 짧은 클립을 만들어 헤드폰으로 들어본 후, 본격적으로 진행하세요.
이름이 계속 틀리게 나온다면, 발음대로 철자를 바꾸는 게 도움이 될 수 있습니다. 여러분의 스크립트로 만들어진 자막도 그 철자를 보여줄 테니, 자막 트랙을 수정할 계획을 세우세요. 화면에서 잘 재생되는 대사에 대해 더 알고 싶다면, AI 영화 장면에 대사 추가하는 팁을 참고하세요.
왜 대사를 다른 캐릭터가 말하나요?
두 사람이 한 샷에 있고 프롬프트가 「그녀가 말한다, '난 떠날 거야'」라고 하면, 모델은 「그녀」가 누군지 추측해야 합니다. 네이티브 오디오 모델은 텍스트와 이미지로 그 결정을 내리죠. 단서가 약하면 더 중심에 있는 얼굴이나 먼저 언급된 사람을 선택하거나, 바꿔 버립니다. 주고받는 대사를 짧은 클립 하나에 우겨 넣으면 더 나빠집니다. 모델이 순서까지 결정해야 하기 때문이죠.
해결책은 스크립트 슈퍼바이저가 쓰는 방법들입니다:
- 각 대사마다
마야: "표를 간직했어?"처럼 화자 레이블과 함께 별도의 줄에 쓰세요. - 「노란색 비옷을 입은 마야」처럼 카메라가 볼 수 있는 방식으로 각 화자를 한 번 설명하고, 그 후에는 같은 이름을 계속 사용하세요. 두 캐릭터가 한 샷에 있을 때는 대명사를 피하세요.
- 각 클립에는 최대 한두 개의 대사만 담고, 대화가 길어지면 답변은 다음 클립으로 옮기세요.
- 말하는 사람을 샷의 주체로 만드세요: 「마야를 클로즈업하며 그녀가 묻는 모습」.
음성은 맞는데 얼굴이 여러분이 캐스팅한 사람과 맞지 않는다면, 그것은 별개의 문제입니다. AI 동영상에서 내 얼굴이 이상하게 보이는 이유에서 해결책을 확인하세요.
AI 동영상은 영어 외의 언어로 말할 수 있나요?
네, 가능합니다. 하지만 대부분의 모델은 영어로 후퇴하기 쉬우며, 혼합된 지시는 이를 더 부추깁니다. 위의 Flow 리뷰어는 힌글리시로 작성했지만 영어 더빙을 받았습니다. HeyGen과 Fliki 리뷰어들은 힌디어와 마라티어 관련 문제를 제기했고, Synthesia 리뷰어들은 일부 프랑스어 음성이 로봇 같다고 지적했습니다.
영어가 아닌 언어로 된 영화를 훨씬 더 안정적으로 만들려는 몇 가지 습관이 있습니다:
- 대사 자체를 목표 언어로 작성하세요. 「그녀가 힌디어로 인사한다」는 모델에게 즉석 번역을 요구하는 것이고, 힌디어로 작성된 대사는 번역할 게 남아있지 않습니다.
- 한 줄에 한 언어를 사용하세요. 문장 중간에 언어를 바꾸는 순간, 음성이 가장 자주 영어로 돌아갑니다.
- 도구에 언어 설정이 있다면, 프롬프트에 의존하기보다 그것을 사용하세요.
- 첫 테스트 클립에서 이름이나 차용어를 들어보세요. 이것들이 가장 먼저 틀리기 때문입니다.
Cinely에서는 영화의 언어를 선택하거나 자동 감지하게 할 수 있습니다. Cinely가 지원하는 언어 전체 목록을 참고하세요.
AI 동영상에 자막을 어떻게 추가하나요?
자막은 두 가지 일을 합니다. 많은 사람들이 짧은 영상을 음소거 상태로 보며, 자막은 귀로 놓친 실수를 잡아줍니다. AI 동영상에 자막을 얻는 방법은 세 가지입니다:
- 스크립트에서: 단어들은 여러분이 작성한 그대로이며, 음성에 맞춰 시간이 조정됩니다.
- 음성 인식에서: 도구가 완성된 오디오를 듣고 필사합니다. 변경된 대사를 포함해 실제로 말한 내용을 잡아내지만, 이름을 잘못 알아들을 수 있습니다.
- 고정 자막 또는 트랙으로: 고정 자막은 영상의 일부라 나중에 고칠 수 없습니다. 별도의 트랙은 편집하거나 숨기거나 번역할 수 있습니다.
어느 방식을 사용하든, 발표하기 전에 자막을 오디오와 한 번 비교해서 읽어보세요.
소리가 있는 AI 동영상 생성기를 결제하기 전에 확인할 사항
크레딧을 구매하기 전에, 샘플 클립과 소리를 키워서 다음 질문에 답해보세요:
- 여러분의 요금제가 소리를 생성하나요, 아니면 무음 클립을 만드나요?
- 정확한 대사를 직접 작성할 수 있나요, 아니면 도구가 대사를 자체 작성하나요?
- 캐릭터별로 음성을 선택할 수 있나요, 그리고 한 장면에 실제로 몇 개의 음성이 적용되나요?
- 언어 설정이 있나요, 그리고 여러분의 언어를 포함하나요?
- 자막이 포함되어 있고, 편집 가능하며, 무료인가요?
- 본격 렌더링 전에 무료 미리보기나 저렴한 짧은 테스트가 있나요?
- 한 줄의 형편없는 대사를 고치는 데 드는 비용은 얼마인가요, 그리고 실패한 렌더링은 환불되나요?
음성이 있는 AI 동영상 생성기라면 가격 또는 도움말 페이지에서 이에 답해야 합니다. 그렇지 않다면, 재시도는 여러분의 몫이라고 가정하세요.
Cinely AI 무비 메이커는 음성, 소리, 자막을 어떻게 처리하나요?
Cinely는 아이디어나 스크립트를 8초씩의 장면으로 이루어진 영화로 바꾸는 AI 무비 메이커로, 웹, iOS, Android에서 이용할 수 있습니다. 소리가 작동하는 방식과 한계는 다음과 같습니다.
대사. 아이디어 탭에서는 Cinely가 스토리를 작성하고, 대부분의 장르에서 각 장면에 한두 개의 말하는 대사를 줍니다. 스크립트 탭에서는 여러분이 작성한 대로, 장면마다, 대사는 단어 하나하나 그대로 영화로 만들어집니다. 대사가 없는 장면에는 음성이 없습니다. 전체 스크립트에 대사가 없다면 음악과 효과음만으로 재생되며, 장면이 보여주는 것을 말하는 짧은 대사 하나씩을 AI가 추가하도록 허용하지 않는 한 말이 나오지 않습니다.
화자. 스크립트 탭은 이름: "대사" 같은 화자 레이블과 「장면 1:」 또는 INT./EXT. 같은 헤딩으로 캐스트를 구성합니다. 무료 AI 스크립트 체크는 8초 클립에 맞는 페이싱, 화자 레이블, 헤딩, 콘텐츠 규칙 문제를 표시하며, 적용을 누르지 않는 한 아무것도 변경하지 않습니다.
음성. 무료 미리보기에서 각 캐릭터는 음높이로 필터링할 수 있는 선택기에서 음성을 받거나, 적합한 음성을 선택하는 자동 설정을 받습니다. 솔직한 한계: 스탠다드와 프로 요금제에서는 첫 번째 캐릭터가 선택한 음성만 적용됩니다. 다른 화자들은 여러분의 선택 없이 모델이 음성을 부여합니다. 시네마틱에서는 1~3명의 캐릭터로 구성된 캐스트가 캐릭터 에셋으로 구축되어 각 캐릭터만의 얼굴과 음성을 유지합니다. 시네마틱은 장면당 30이 아닌 60크레딧이 소요되며, 웹에서는 Cinely 프리미엄이 필요합니다.
효과음과 음악. 별도의 음악 트랙이나 더빙된 음성이 없습니다. 소리와 음악은 비디오 모델 자체의 오디오에서 나오며, 명시적인 기악 음악 지시는 무성영화나 대사 없는 장면에만 작성됩니다.
언어와 자막. 스토리는 17개 언어로 생성되거나, 언어가 자동 감지될 수 있습니다. 스크립트 탭의 대사는 여러분이 선택한 영화 언어로 번역되므로, 단어 그대로를 원한다면 대사를 작성한 언어를 선택하세요. 자동 자막은 토글로, 기본값은 꺼져 있습니다. 영화가 완성되면 추가 비용 없이 17개 언어 모두로 자막이 생성되며, 편집기에서 트랙을 편집할 수 있습니다.
비용과 수정. 미리보기를 승인할 때만, 표시된 장면에 대해 비용을 지불합니다: 스탠다드 장면당 30크레딧. 실패한 장면은 자동으로 환불됩니다. 렌더링은 됐지만 대사를 형편없이 전달한 장면은 환불되지 않으며, 편집기에서 고치는 데는 60크레딧이 고정적으로 듭니다. 안전 필터가 음성 대사를 단독으로 차단할 수도 있습니다. 이런 일이 발생하면 AI가 해보일 것 같은 프롬프트를 차단하는 이유를 읽어보세요.
단계별: Cinely로 음성이 있는 단편 영화 만들기
- Cinely 생성 페이지를 열고 스크립트 탭을 선택하세요. 아이디어 탭에 스크립트를 붙여넣으면 Cinely가 이동을 제안할 겁니다.
- 장면당 하나의 헤딩과 그 아래에 한두 개의 짧은 레이블 달린 대사를 쓰세요:
장면 1: 밤, 비에 젖은 버스 정류장
마야: "표를 간직했어?"
레오: "모든 걸 간직했어."
- 무료 AI 스크립트 체크를 실행하고, 동의하는 제안만 적용하세요.
- 영화 언어를 선택하거나 자동 감지로 두고, 자막을 원한다면 자동 자막을 켜세요.
- 「생성 전 미리보기」를 켜두세요. 미리보기에서 각 장면에 누가 나타나는지 확인하고 음성을 선택하세요. 스탠다드와 프로는 첫 번째 캐릭터의 음성만 적용된다는 점을 기억하세요.
- 먼저 2장면짜리 영화(16초, 60 스탠다드 크레딧)로 시작하세요. 화자, 언어, 타이밍을 들어보세요. 무료 계정은 기본적으로 최대 6장면(48초)의 영화를 만들 수 있습니다.
- 전체 영화가 완성되면, 편집기를 열고 자막 트랙을 오디오와 대조해서 읽어보세요.
소리는 AI 클립이 장면처럼 느껴지기 시작하는 지점입니다. 짧은 레이블 달린 대사를 쓰고, 의도적으로 음성을 선택하며, 발표하는 모든 것에는 자막을 켜두고, 먼저 짧은 편집본으로 테스트하세요. 준비가 되었다면, 첫 대사 장면을 작성해 보세요: 미리보기는 무료이며, 어떤 크레딧도 소비되기 전에 모든 장면과 음성을 검토할 수 있습니다.
- 왜 많은 AI 동영상에 소리가 전혀 없나요?
- 초기 AI 동영상 모델은 이미지만 생성하고, 이후에 따로 텍스트 음성 변환을 통해 소리를 얹는 방식이 많았기 때문입니다. 이렇게 생성된 영상은 입 모양이 음성과 맞지 않거나 아예 무음일 수 있어요.
- 자연스러운 음성과 입모양 동기화를 얻으려면 어떻게 하나요?
- 화자의 얼굴을 중간 샷이나 클로즈업으로 보여주고, 장면 길이에 맞는 짧은 대사를 사용하세요. 또한 '그녀가 속삭이며'처럼 연기 지시를 추가하고, 캐릭터에 맞는 음성을 의도적으로 선택하세요. 본격 제작 전에 짧은 클립으로 테스트하는 게 좋습니다.
- 영어 외의 언어로 AI 동영상을 만들 수 있나요?
- 네, 가능합니다. 하지만 대부분의 모델은 영어에 가장 익숙하므로, 대사 자체를 원하는 언어로 작성하고, 한 문장에 한 언어를 사용하며, 도구의 언어 설정을 활용하면 훨씬 안정적인 결과를 얻을 수 있습니다. Cinely는 17개 언어를 지원합니다.
- AI 동영상에 자막을 어떻게 추가하나요?
- 스크립트에서 자막을 생성하거나, 음성 인식으로 자막을 만들 수 있습니다. 후자는 실제 음성을 전사하지만 이름 등을 잘못 알아들을 수 있어요. 자막을 동영상에 고정시키거나 별도의 트랙으로 저장해 편집할 수 있습니다.
Written with AI assistance and edited by the Cinely Team.