AI Tạo Video Có Âm Thanh, Giọng Nói và Phụ Đề: Khắc Phục Sự Cố Thường Gặp

Bạn vừa tạo xong một clip AI ưng ý, nhấn phát và… im lặng. Hoặc có tiếng nói, nhưng lại là giọng sai nhân vật, ngôn ngữ không đúng, hoặc lời nói chậm hơn cử động môi nửa giây.
Vấn đề nằm ở cách xử lý âm thanh: nhiều công cụ AI video cũ chỉ tạo hình ảnh rồi mới ghép giọng đọc (text-to-speech) vào sau, trong khi các mô hình mới tạo âm thanh cùng lúc với hình nhưng lại tự «quyết định» ai nói và nói thế nào. Một trình tạo video AI có âm thanh hoạt động tốt nhất khi bạn cung cấp nhãn người nói rõ ràng, lời thoại ngắn phù hợp, giọng nói được chọn có chủ đích và phụ đề có thể chỉnh sửa.
Hướng dẫn này giải thích lý do âm thanh bị lỗi, cách khắc phục chung và cách Cinely xử lý giọng nói, nhạc và phụ đề, bao gồm cả các giới hạn.
Các sự cố âm thanh AI video mà người dùng thường phàn nàn
Vào tháng 9/2026, chúng tôi đã đọc hơn 12.000 đánh giá 1-2 sao của 63 ứng dụng trên App Store, Google Play, Trustpilot và Capterra. Vấn đề âm thanh chiếm tỷ lệ thấp hơn so với phàn nàn về thanh toán, thường từ 2-7% số đánh giá thấp của các ứng dụng video, và khoảng 1/10 với các công cụ avatar nói như HeyGen hay Synthesia. Tuy nhiên, chúng lại rất cụ thể và có thể chia thành 5 kiểu:
- Hoàn toàn không có âm thanh. Một người đánh giá trên Google Play về ứng dụng AI Video của HubX nói clip chỉ dài khoảng 2 giây và «video hoàn toàn không có tiếng». Người dùng Hailuo báo cáo clip không có âm thanh, không lời dẫn và không phụ đề. Một người dùng Luma nói bạn phải trả tiền cho phần mềm khác chỉ để thêm nhạc.
- Giọng nói nghe sai. Một người đánh giá trên Trustpilot gọi giọng đọc của Steve AI là robot và không thể dùng được. Người dùng Synthesia nói nhấn nhá đôi khi sai mà không có cách sửa, còn người dùng HeyGen nói bản sao giọng của họ chẳng giống chút nào.
- Giọng nói bị trôi hoặc trễ. Người dùng Vidu nhận thấy giọng nói đến sau khi miệng cử động, còn người dùng Hedra nói việc đồng bộ môi khi hát bị sai. Một người dùng InVideo thấy «giọng nói khác nhau ở tất cả các clip» và tên nhân vật bị phát âm sai.
- Sai người nói. Một người dùng Sora trên Google Play viết: «Hội thoại bị đảo ngược giữa các nhân vật».
- Sai ngôn ngữ, hoặc nói những thứ không được yêu cầu. Người dùng Google Flow nói ứng dụng «hoàn toàn bỏ qua hướng dẫn bằng Hinglish/Hindi và ép buộc dùng giọng đọc tiếng Anh». Người dùng Runway nhận được giọng nói tiếng Trung mà họ không yêu cầu, còn người dùng Kling yêu cầu không có lời nói nhưng nhân vật vẫn cứ nói.
Trải nghiệm có thể khác nhau và các ứng dụng thay đổi thường xuyên, nhưng mô hình thì vẫn vậy. Mỗi lần thất bại cũng tiêu tốn tiền, vì cách sửa thông thường là tạo lại clip khác (có trả phí). Đó là một lý do tại sao credit tạo video AI lại hết nhanh đến vậy.
Tại sao nhiều video AI không có âm thanh?
Hầu hết mô hình AI video khởi đầu chỉ là hệ thống tạo hình ảnh, và các công cụ ghép âm thanh vào theo một trong hai cách.
Cách cũ là render clip câm rồi thêm bước âm thanh riêng. Một trình tạo video AI với lồng tiếng kinh điển sẽ render clip trước, sau đó đọc văn bản của bạn bằng giọng text-to-speech và đặt lên trên, đôi khi kèm nhạc nền có sẵn. Bạn kiểm soát chính xác từ ngữ và có thể đổi giọng dễ dàng. Nhưng khuôn mặt được tạo hình mà không biết sẽ nói gì, nên miệng cử động ngẫu nhiên trừ khi một mô hình đồng bộ môi riêng biệt vẽ lại chúng. Ứng dụng bỏ qua bước âm thanh sẽ chỉ đưa cho bạn một clip câm.
Cách mới hơn là âm thanh gốc (native audio): mô hình tạo ra hình ảnh, lời nói, hiệu ứng và âm thanh nền cùng lúc từ lệnh của bạn. Miệng và lời nói khớp nhau hơn vì được tạo cùng nhau. Cái giá phải trả là sự kiểm soát, vì mô hình tự quyết định ai nói, giọng thế nào và đôi khi dùng ngôn ngữ nào. Mỗi clip mới có thể có một giọng nói hơi khác, và sự «trôi» này tích tụ trong một bộ phim dài, đó là lý do tại sao việc lên kế hoạch cách tạo một video AI dài để kể chuyện cũng quan trọng như giọng nói.
| Điểm so sánh | Video câm cộng thêm lồng tiếng | Âm thanh gốc (Native audio) |
|---|---|---|
| Cách tạo âm thanh | Thêm vào sau khi hình ảnh được render | Được tạo cùng lúc với hình ảnh trong một lần |
| Thường tốt ở | Từ ngữ chính xác, giọng bạn chọn, thử lại âm thanh rẻ | Môi khớp lời nói, âm thanh nền và hiệu ứng |
| Thường gặp sự cố | Môi không khớp, cách đọc đều đều, cần thêm bước đồng bộ môi | Sai người nói, giọng thay đổi giữa các clip, thừa hoặc thiếu lời, trôi ngôn ngữ |
Làm thế nào để có giọng nói tự nhiên và đồng bộ môi?
Đồng bộ môi trong video AI thất bại thường do những lý do đơn giản, có thể sửa được: mặt quá nhỏ hoặc quay đi, hoặc câu thoại quá dài so với clip. Những thói quen sau giúp ích trong mọi công cụ:
- Giữ khuôn mặt người nói hiển thị rõ. Cảnh trung hoặc cận cảnh cho mô hình thấy miệng để tạo hoạt ảnh. Cảnh quần chúng rộng, góc nghiêng và phía sau đầu làm tình trạng đồng bộ tệ hơn.
- Viết câu thoại phù hợp với độ dài clip. Mọi người nói hai đến ba từ mỗi giây, vì vậy một clip 8 giây chứa khoảng 15 từ với khoảng trống để thở. Câu dài hơn sẽ bị đọc vội hoặc cắt ngang giữa chừng.
- Nói rõ cách câu thoại được thể hiện. «Cô ấy thì thầm», «anh ấy cười khi nói» hoặc «hét lên trong cơn mưa» cho giọng nói một thứ để diễn. Không có gợi ý, cách đọc sẽ trở nên đều đều.
- Chọn giọng nói có chủ đích. Khớp độ tuổi, âm vực và năng lượng với nhân vật. Một giọng trầm cho một thiếu niên nghe như lỗi lồng tiếng ngay cả khi môi hoàn hảo.
- Thử nghiệm trước khi render đầy đủ. Tạo một hoặc hai clip ngắn, nghe bằng tai nghe, rồi mới quyết định.
Nếu một cái tên cứ bị phát âm sai, đánh vần nó theo cách nghe có thể giúp ích. Phụ đề được xây dựng từ kịch bản của bạn cũng sẽ hiển thị cách đánh vần đó, vì vậy hãy lên kế hoạch sửa track phụ đề. Để biết thêm về cách viết lời thoại phù hợp trên màn hình, hãy xem các mẹo viết hội thoại trong cảnh phim AI.
Tại sao nhân vật sai lại nói câu thoại?
Khi hai người chia sẻ một cảnh quay và lệnh nói «cô ấy nói, tôi đi đây», mô hình phải đoán «cô ấy» là ai. Các mô hình âm thanh gốc đưa ra quyết định đó từ văn bản và hình ảnh. Khi các gợi ý yếu, chúng chọn khuôn mặt trung tâm hơn hoặc khuôn mặt được nhắc đến đầu tiên, hoặc chúng đảo ngược. Nhồi nhét một cuộc đối thoại qua lại vào một clip ngắn làm vấn đề tệ hơn, vì mô hình cũng phải quyết định thứ tự.
Cách khắc phục là những cách mà một người giám sát kịch bản sẽ sử dụng:
- Đặt mỗi câu thoại trên một dòng riêng với nhãn người nói, như
MAI: "Em giữ vé à?" - Mô tả mỗi người nói một lần theo cách máy quay có thể thấy, chẳng hạn «Mai, trong chiếc áo mưa màu vàng», sau đó dùng cùng tên đó mọi lúc. Tránh dùng đại từ khi hai nhân vật cùng trong một cảnh quay.
- Cho mỗi clip tối đa một hoặc hai câu thoại, và chuyển phần trả lời sang clip tiếp theo nếu cuộc trao đổi dài hơn.
- Làm cho người nói trở thành chủ thể của cảnh quay: «Cận cảnh Mai khi cô ấy hỏi.»
Nếu giọng nói đúng nhưng khuôn mặt không khớp với người bạn chọn, đó là một vấn đề riêng với các cách khắc phục của nó, được đề cập trong lý do video AI với khuôn mặt của bạn có thể trông sai.
Video AI có nói được các ngôn ngữ khác ngoài tiếng Anh không?
Có, nhưng tiếng Anh là nơi hầu hết các mô hình «rơi vào» mặc định, và các hướng dẫn pha trộn sẽ đẩy chúng về đó. Người đánh giá Flow ở trên đã viết bằng Hinglish và nhận được giọng đọc tiếng Anh. Người dùng HeyGen và Fliki nêu vấn đề với tiếng Hindi và Marathi, còn người dùng Synthesia thấy một số giọng tiếng Pháp như robot.
Một vài thói quen giúp một bộ phim không phải tiếng Anh đáng tin cậy hơn nhiều:
- Viết chính lời thoại bằng ngôn ngữ mục tiêu. «Cô ấy nói xin chào bằng tiếng Hindi» yêu cầu mô hình dịch ngay lập tức; một câu viết bằng tiếng Hindi không có gì để dịch.
- Giữ một ngôn ngữ cho mỗi dòng. Chuyển đổi ngôn ngữ giữa câu là lúc giọng nói thường xuyên trượt về tiếng Anh nhất.
- Nếu công cụ có cài đặt ngôn ngữ, hãy dùng nó thay vì chỉ dựa vào lệnh.
- Lắng nghe tên và từ mượn trong clip thử nghiệm đầu tiên, vì chúng thường bị sai đầu tiên.
Cinely cho phép bạn chọn ngôn ngữ của phim hoặc tự động phát hiện; đây là danh sách đầy đủ các ngôn ngữ Cinely hỗ trợ.
Làm thế nào để thêm phụ đề vào video AI?
Phụ đề làm hai việc: nhiều người xem video ngắn ở chế độ tắt tiếng, và chú thích phát hiện những lỗi mà tai bạn bỏ sót. Bạn có thể có video AI với phụ đề theo ba cách:
- Từ kịch bản. Từ ngữ chính xác những gì bạn viết, được căn thời gian theo lời nói.
- Từ nhận dạng giọng nói. Một công cụ lắng nghe âm thanh đã hoàn thành và chuyển nó thành văn bản. Nó bắt được những gì thực sự được nói, bao gồm cả các câu đã thay đổi, nhưng nó có thể nghe nhầm tên.
- Chèn vào hình hoặc dưới dạng track riêng. Phụ đề chèn vào hình là một phần của hình ảnh và không thể sửa sau. Một track riêng có thể được chỉnh sửa, ẩn hoặc dịch.
Dù dùng cách nào, hãy đọc lại phụ đề một lần so với âm thanh trước khi bạn xuất bản.
Cần kiểm tra gì trước khi trả tiền cho trình tạo video AI có âm thanh
Trước khi mua credit, hãy trả lời những câu hỏi này bằng một clip mẫu và bật âm lượng:
- Gói của bạn có tạo ra âm thanh hay không, hay chỉ là clip câm?
- Bạn có thể viết chính xác lời thoại không, hay công cụ tự viết?
- Bạn có thể chọn giọng cho mỗi nhân vật không, và thực tế bao nhiêu giọng được áp dụng trong một cảnh?
- Có cài đặt ngôn ngữ không, và nó có hỗ trợ ngôn ngữ của bạn?
- Phụ đề có được bao gồm, có thể chỉnh sửa và miễn phí không?
- Có bản xem trước miễn phí hoặc thử nghiệm ngắn rẻ tiền trước khi render đầy đủ không?
- Chi phí sửa một câu thoại bị thể hiện tệ là bao nhiêu, và các lần render thất bại có được hoàn tiền không?
Bất kỳ trình tạo video AI nào có giọng nói đều nên trả lời những điều này trên trang giá hoặc trang trợ giúp. Nếu không, hãy coi như việc thử lại là do bạn chịu trách nhiệm.
Cinely xử lý giọng nói, âm thanh và phụ đề như thế nào?
Cinely là một công cụ tạo phim AI biến ý tưởng hoặc kịch bản thành một bộ phim gồm các cảnh 8 giây, hoạt động trên web, iOS và Android. Dưới đây là cách âm thanh hoạt động, bao gồm cả các giới hạn.
Hội thoại. Trên tab Ý tưởng, Cinely viết cốt truyện và cho mỗi cảnh một hoặc hai câu nói trong hầu hết các thể loại. Trên tab Kịch bản, nó quay chính xác những gì bạn viết, cảnh đối cảnh, và giữ nguyên từng chữ hội thoại của bạn. Một cảnh không có hội thoại sẽ không có lời nói. Nếu toàn bộ kịch bản không có, phim sẽ phát chỉ với nhạc và âm thanh, trừ khi bạn để AI thêm một câu ngắn mỗi cảnh nói lên những gì cảnh đó thể hiện.
Người nói. Tab Kịch bản xây dựng dàn diễn viên của bạn từ nhãn người nói TÊN: "câu thoại" và đọc các tiêu đề «Cảnh 1:» hoặc INT./EXT. Một tính năng kiểm tra kịch bản AI miễn phí sẽ đánh dấu nhịp độ cho clip 8 giây, nhãn người nói, tiêu đề và các vấn đề về quy tắc nội dung, và không thay đổi gì trừ khi bạn nhấn Áp dụng.
Giọng nói. Trong bản xem trước miễn phí, mỗi nhân vật nhận một giọng nói từ bộ chọn mà bạn có thể lọc theo âm vực, hoặc chế độ Tự động, sẽ chọn một giọng phù hợp. Giới hạn thực tế: trong gói Standard và Pro, chỉ giọng đã chọn của nhân vật đầu tiên được áp dụng; những người nói khác được mô hình lồng tiếng mà không có sự lựa chọn của bạn. Trong gói Cinematic, một dàn diễn viên từ một đến ba nhân vật được xây dựng dưới dạng tài sản nhân vật, mang theo khuôn mặt và giọng nói riêng của mỗi nhân vật. Cinematic có giá 60 credit mỗi cảnh thay vì 30, và trên web nó cần Cinely Premium.
Âm thanh và nhạc. Không có track nhạc riêng biệt hoặc lồng tiếng bổ sung. Âm thanh và nhạc đến từ chính âm thanh gốc của mô hình video, và các gợi ý nhạc cụ rõ ràng chỉ được viết cho các cảnh phim câm và cảnh không có hội thoại.
Ngôn ngữ và phụ đề. Câu chuyện có thể được tạo bằng 17 ngôn ngữ, hoặc ngôn ngữ có thể được tự động phát hiện. Một kịch bản trên tab Kịch bản được dịch sang ngôn ngữ phim bạn chọn, vì vậy hãy chọn ngôn ngữ mà các câu thoại của bạn được viết nếu bạn muốn chúng đúng từng chữ. Tự động phụ đề là một nút bật/tắt, tắt theo mặc định. Khi phim hoàn tất, phụ đề được tạo bằng cả 17 ngôn ngữ mà không mất phí, và bạn có thể chỉnh sửa các track trong trình chỉnh sửa.
Chi phí và sửa lỗi. Bạn chỉ trả tiền khi phê duyệt bản xem trước, cho các cảnh được hiển thị: 30 credit mỗi cảnh Standard. Các cảnh render thất bại được hoàn tiền tự động. Một cảnh đã render nhưng thể hiện câu thoại tệ sẽ không được hoàn tiền, và việc sửa nó trong trình chỉnh sửa có giá cố định 60 credit. Bộ lọc an toàn cũng có thể tự chặn hội thoại nói; nếu điều đó xảy ra, hãy đọc lý do AI chặn các lệnh trông vô hại.
Từng bước: một phim ngắn có giọng nói trên Cinely
- Mở trang tạo của Cinely và chọn tab Kịch bản. Nếu bạn dán kịch bản vào tab Ý tưởng, Cinely sẽ đề nghị chuyển nó.
- Viết một tiêu đề cho mỗi cảnh và một hoặc hai câu ngắn có gắn nhãn bên dưới:
Cảnh 1: Một trạm xe buýt đẫm mưa vào đêm
MAI: "Em giữ vé à?"
LONG: "Em giữ tất cả."
- Chạy tính năng kiểm tra kịch bản AI miễn phí và chỉ áp dụng những gợi ý bạn đồng ý.
- Chọn ngôn ngữ phim hoặc để chế độ tự động phát hiện, và bật Tự động phụ đề nếu bạn muốn.
- Giữ «Xem trước trước khi tạo» ở chế độ bật. Trong bản xem trước, kiểm tra ai xuất hiện trong mỗi cảnh và chọn giọng nói, nhớ rằng Standard và Pro chỉ áp dụng giọng của nhân vật đầu tiên.
- Bắt đầu với một phim 2 cảnh: 16 giây với 60 credit Standard. Lắng nghe người nói, ngôn ngữ và thời gian. Tài khoản miễn phí có thể tạo phim lên đến 6 cảnh (48 giây) theo mặc định.
- Khi phim đầy đủ hoàn tất, mở trình chỉnh sửa và đọc các track phụ đề so với âm thanh.
Âm thanh là nơi một clip AI bắt đầu cảm thấy như một cảnh phim. Viết những câu thoại ngắn có gắn nhãn, chọn giọng nói có chủ đích, giữ phụ đề bật cho bất cứ thứ gì bạn xuất bản, và thử nghiệm một đoạn ngắn trước. Khi bạn đã sẵn sàng, hãy viết cảnh đầu tiên của bạn với hội thoại: bản xem trước là miễn phí, và bạn xem xét từng cảnh và giọng nói trước khi bất kỳ credit nào được sử dụng.
- Tại sao nhiều video AI không có âm thanh?
- Nhiều công cụ tạo video trước đây chỉ tập trung vào hình ảnh, sau đó mới ghép âm thanh và giọng đọc riêng. Một số ứng dụng thậm chí bỏ qua bước này, khiến clip hoàn toàn không có tiếng. Các mô hình mới hơn tạo âm thanh cùng lúc với hình ảnh nhưng lại tự quyết định ai nói và nói thế nào.
- Làm thế nào để môi khớp lời nói tự nhiên?
- Hãy đảm bảo khuôn mặt người nói rõ ràng (cận mặt hoặc trung cảnh), viết lời thoại ngắn gọn (khoảng 15 từ cho clip 8 giây), mô tả cách nói (thì thầm, cười khi nói) và chọn giọng phù hợp với nhân vật. Luôn thử nghiệm với clip ngắn trước.
- Làm sao để đúng nhân vật nói đúng lời?
- Gán nhãn rõ ràng cho từng nhân vật (ví dụ: MAI: "Em giữ vé à?"). Mô tả đặc điểm nhận dạng cho mỗi nhân vật và dùng tên đó xuyên suốt. Tránh dùng đại từ (cô ấy, anh ấy) khi trong cảnh có hai người. Tốt nhất là mỗi clip chỉ nên có 1-2 câu thoại.
- AI video có tạo được tiếng Việt không?
- Có, nhưng nhiều mô hình có xu hướng mặc định về tiếng Anh. Để đáng tin cậy, hãy viết trực tiếp lời thoại bằng tiếng Việt (thay vì ra lệnh "nói tiếng Việt"), giữ nguyên một ngôn ngữ trong mỗi câu, và sử dụng cài đặt ngôn ngữ của công cụ nếu có. Kiểm tra kỹ cách phát âm tên riêng.
- Thêm phụ đề vào video AI như thế nào?
- Có ba cách chính: Từ kịch bản (chính xác từng chữ), từ nhận dạng giọng nói (bắt đúng âm thanh thực tế, nhưng dễ sai tên), và dưới dạng track riêng (có thể chỉnh sửa) hoặc chèn vào hình (không sửa được). Dù dùng cách nào, hãy đối chiếu phụ đề với âm thanh trước khi xuất bản.
Written with AI assistance and edited by the Cinely Team.