如何制作一部能讲好故事的长AI电影

你曾将一整场戏的文本输入AI视频生成器,结果只得到8秒的片段。或者你生成了十几个片段,却发现主角的脸在其中一半里变了样。如果你正在琢磨如何制作一部能讲好故事的长AI视频,最直接的答案是:没有人能一次生成完整的长片。
你需要将其规划为一系列短镜头,在开始前锁定角色和风格,然后将这些镜头拼接成一部完整的电影。拼接工作可以手动在剪辑软件中完成,也可以使用能将剧本自动转换为场景并拼接的工具。片段时长限制源于这些模型的工作原理,因此制胜关键在于周边工作:镜头清单、参考图像,以及你愿意为“重试”投入多少。
如果“额度”是阻碍你的主要问题,建议先阅读为什么AI视频生成器的额度消耗得那么快?,再回来看具体的工作流程。
当AI片段“秒数告罄”时,用户们在抱怨什么?
我们曾分析过超过12,000条来自App Store、Google Play等平台对63款应用的一星和两星评价。直接抱怨片段时长的只占一小部分(约3%-6%),但这个问题隐藏在众多关于“费钱”的投诉之下:用户试图用5秒的片段构建一个故事,却在故事讲完前就耗尽了额度。
以下是评价中提及的片段时长(请注意,应用的限制常变动,此表仅为快照,非固定规格):
| 应用 | 评价中描述的片段时长 |
|---|---|
| Sora (已停服) | 10 到 15 秒 |
| Google Flow | 4 到 10 秒 |
| Luma Dream Machine | 约 5 秒 |
| Kling | 最长 15 秒 |
| 海螺AI | 6 到 10 秒 |
| Vidu | 8 秒 (此前为10秒) |
| Kaiber | 6 秒 |
| 万兴播爆 | 5 到 8 秒 |
| HubX AI Video | 2 到 5 秒 |
挫败感无处不在。一位Sora的Google Play用户写道:「我讨厌只能做10秒的片段。」一位Kaiber的App Store用户质问:「说好的8分钟视频呢!」一位Runway的用户则直接点出了讲故事者的困境:「当需要多个连贯场景时,体验变得非常令人沮丧。」
时长也放大了成本。一位万兴播爆的用户说,一段约1分钟的视频就用光了他的AI额度;一位Kling的用户则表示,花费1450卢比也没能完成一段完整的3-5分钟视频。在购买任何服务前,最好先算清楚制作一分钟AI电影的真实成本是多少。如果你曾是Sora用户,正在为长故事寻找新家,可以参考我们的Sora替代方案指南。
为什么AI视频生成器都停留在5到10秒?
视频模型并非在“拍摄”,它需要同时生成一个片段的所有帧,并确保每一帧与其他帧保持一致。每增加一秒,就意味着需要同时维持连贯的帧数更多,单次生成的计算量更大,从而导致等待时间更长、单片段成本更高。短暂的时长限制是为了将生成时间控制在几分钟内,并使单片段成本可控。
时长也会损害质量。一次生成运行得越久,它“漂移”的空间就越大:一张脸可能变得模糊,一只手可能多出一根手指,街道可能在半途改头换面。虽然有些技巧可以从最后一帧延伸片段以保持动作连贯,但每一次“跳跃”都可能增加一点漂移。
这并非致命问题,因为真正的电影也是由短镜头组成的,大部分剪辑镜头也只持续几秒。真正的问题是:每个片段都是独立生成的,没有对前一个片段的记忆,因此角色、房间和情节可能在每次剪辑时都发生变化。制作长AI视频,本质上是一项维护“连续性”的工作。
如何制作超过一分钟的AI视频?
如果你想寻找能直接生成超过30秒片段的AI视频工具,诚实的答案是:大多数工具提供的是片段,时长来自于剪辑。手动路线适用于任何生成器。
先算笔账
用目标时长除以单片段时长。用8秒的片段拼出1分钟需要8个镜头;用5秒的片段则需要12个。一个3分钟的故事,若每个片段5秒,就需要36个镜头。然后还要加上重试预算:多个平台的用户都提到,为一个可用的镜头可能需要多次尝试,所以请假设有些镜头需要生成两次或更多。
编写镜头清单
为每个镜头写一行描述:谁在里面、他们做什么、摄像机位置、以及任何台词。每个镜头只保留一个动作和一句简短对话,因为8秒容不下长篇大论。我们的多场景AI电影规划指南详细介绍了节奏和故事板。
锁定参考图和单一风格
为每个主要角色制作一张清晰的参考图:面部可见、光线均匀、着装完整。为每个角色写一段固定的描述(姓名、年龄、头发、衣服),并将完全相同的文字粘贴到每个提示词中。选择一种风格、一个模型和一种画幅比例,并且不要在影片中途切换,因为不同的模型就像不同的摄像机,剪辑时会暴露差异。
在剪辑软件中拼接并完成
按顺序将片段拖到时间线上,修剪每个片段开头和结尾不稳定的帧。添加统一的背景音乐和贯穿始终的一致人声,因为声音可以掩盖许多小的跳跃。在投入数小时编辑之前,请检查导出规则:CapCut、万兴播爆和VEED的用户都报告过仅在导出时出现的付费墙,以及意想不到的水印。
如何保持角色和故事在不同片段间的一致性?
这是大多数长AI视频失败的地方。在对Runway、Pika、Luma、Sora和Google Veo等工具的低星评价中,明确提到角色漂移的只占约5%到9%,但对于其中的故事讲述者和系列创作者来说,这是主要的抱怨。一位Google Flow的用户写道:「大约只有五分之一的作品能正确保持我的身份。」一位Runway的App Store用户表示,他们提供了完整的剧本、角色设定表和参考图像,但前几个视频仍然用错了人。
模型只知道每个提示词告诉它的内容。将“皮夹克”改成“深色外套”,你就相当于换了个演员。在一个镜头中放入五个人,其中一些人可能会变成陌生人,而侧角、低光和重度风格化都会削弱与参考图的匹配度。
在任何应用中都有帮助的方法是:
- 逐字重复:从一个文本文件中复制粘贴每个角色的描述,确保完全一致。
- 重复使用参考图:每次为同一角色生成时使用同一张参考图。
- 控制角色数量:每个镜头保持两到三个角色。人群场景是面孔互换的重灾区。
- 固定服装:除非剧情需要,否则保持服装不变,并在需要改变时明确说明。
- 注意环境细节:记录时间、天气和道具,并让每个镜头的结束点与下一个镜头的开始点衔接。
情节也需要同样的细心。一个根据单行提示词发明每个片段的生成器,无法遵循它从未看过的故事。因此,先写下整个故事。然后,为每个片段分配其所属的那部分情节,并加上能将其锚定在同一个世界里的要素。关于面部一致性,有更详细的探讨,可参见保持AI角色跨场景一致性的技巧。
能否将完整剧本变成一部长AI视频?
可以,对于超过一分钟的视频,这通常是更好的路线。一个“从文本到电影”的AI生成器,从一开始就能看到整个故事。它可以自动将剧本拆分成场景、根据说话人姓名构建演员表、为每个角色分配参考形象、按顺序渲染场景,并将它们与对话拼接在一起。你就不再需要把角色描述复制粘贴到四十个提示词里了。
但并非所有剧本工具都能产出真正的电影。一位Steve AI的用户表示,其剧本转视频的输出在约40秒处停止,看起来像幻灯片;一位LTX Studio的用户也做了类似的幻灯片比较。在为这类AI电影制作工具付费前,请确认以下几点:
- 它能逐字保留你的对话,还是会进行改写?
- 你能通过标题自己设置场景分隔吗?
- 在一个场景中,有多少角色能保持固定的面孔?
- 在付费渲染前,你能预览和编辑场景吗?
- 你的套餐允许制作多长的电影?
- 完成一分钟的成本是多少?渲染失败的场景会退款吗?
当你需要一个能制作超过1分钟视频的AI生成器时,这份清单能将电影工具与片段工具区分开来。如果你正在自己撰写剧本,用AI撰写电影剧本涵盖了适合短场景的结构和对话技巧。
如何制作长AI视频:分步指南
此方法适用于任何工具。采用“剧本先行”路线的工具会为你完成第6和第7步的大部分工作。
- 用节拍写出故事。每部分一句话:开端、转折、结局。如果它不能用十句话讲清楚,那么用十个镜头也讲不好。
- 确定镜头数量。用目标时长除以片段时长,向上取整,并在预算中为重试留出空间。
- 选定并锁定角色形象。为每个角色准备一张参考图和一个固定描述,每个镜头保持两到三个角色。
- 选择一种风格和一种画幅比例。竖屏适合手机,横屏适合笔记本和电视。整部影片保持统一。
- 测试一个短片段。制作前2-3个镜头并连续观看。现在调整风格或描述,而不是在生成30个片段之后。
- 按顺序生成其余部分。只重做那些破坏连续性的镜头,并保留每个版本,因为有时第二好的镜头剪辑起来效果更佳。
- 拼接、添加声音、导出。使用统一的背景音乐、一致的人声,如果需要,还可以加上字幕。在分享前,一口气完整观看一遍。
声音本身也有陷阱,从静音片段到角色说错台词。我们的为AI视频添加声音、人声和字幕指南涵盖了这些问题。
Cinely制作的电影可以有多长?
最长可达100个场景,约13分20秒。Cinely是一个采用“剧本先行”路线的AI电影制作工具:你描述一个想法或粘贴一个剧本,它会撰写场景、选定角色、将每个场景渲染为8秒的片段,并将它们与声音和可选字幕拼接成一部完整的电影。
时长。一部电影可以是2、4、6、8、10、12、14、16、18、25、50、75或100个场景。这相当于短至16秒(2场景),75场景时正好10分钟,100场景时约13分20秒。影片默认为竖屏9:16,也可选择横屏16:9。
两种入口。「创意」选项卡会根据你的想法自行创作故事,在大多数类型中,每个场景包含一到两句台词;从文本提示制作AI电影介绍了这种方法。「剧本」选项卡则是字面意义上的文本转电影:它按场景拍摄你写的内容,逐字保留你的对话,只添加镜头和视觉细节。它能识别“场景1:”或INT./EXT.等标题(最多100个场景,超过则合并相邻场景),可以将散文转换成剧本,并根据“姓名:「台词」”的说话人标签来构建演员表。
在「剧本」选项卡上,免费的AI剧本检查功能会标记出与8秒片段不匹配的节奏问题、说话人标签、标题以及内容规则问题。除非你点击“应用”,否则它不会做任何修改。
面部。添加一张照片,你就可以被选为主角;这张照片将成为你所出现场景中的面部参考。标准版在一个场景中最多可保持3个固定面孔,而网页端的电影级(Premium模式)最多可保持7个。超出此数量的角色将作为没有固定面孔的群众演员,因此在编写人群场景时需注意这一点。
付费前预览。在创建页面,预览功能默认开启(主页的快速生成框会跳过此步骤)。Cinely会先撰写场景并设定角色风格,然后你可以编辑任何场景的提示词、选择每个场景中出现的人物、重做或替换肖像、并挑选人声。预览是免费的,只有在你确认批准后,才为显示的场景付费。
成本与失败处理。标准版每个8秒场景消耗30积分,因此一部8场景(64秒)的电影需要240积分。如果某些场景渲染失败,电影仍会以成功的场景完成,失败场景的积分将被退还。
限制,明确如下:
- 每个场景固定8秒。你无法得到一个连续的30秒长镜头;长电影总是一系列8秒镜头的组合。
- 免费账户默认最多可生成6个场景,即48秒。更长的电影需要Cinely Premium。
- 即使在Premium套餐下,上限也是100个场景。很长,但并非无限。
- 一个已渲染但效果不佳的场景,在编辑器中修复需要60积分。因“审美不符”不予退款。
从哪里开始
学习制作长AI视频最快的方法,是先从正确制作一部短片开始。写下六个短场景,每个场景以“场景1:”风格的标题开头,并包含一句台词,在批准任何内容前仔细研究免费的预览。当六个场景能连贯在一起时,制作25或50个场景只是同样的工作,只是更长一些。不妨先将你的前六个场景粘贴到「剧本」选项卡中,看看你的故事在哪些地方会“走样”,然后再去挑战更长的篇幅。
- 为什么所有AI视频工具都只能生成几秒钟的片段?
- 视频模型并非实拍,它需要同时生成并协调每一帧。每增加一秒,意味着需要同时处理和保持一致的帧数呈指数级增长,这会导致计算成本飙升、生成时间过长,且质量更易“漂移”(如角色面部变形)。5-10秒的上限是为了控制单次生成的耗时与成本。
- 如何让不同片段中的角色长相保持一致?
- 核心是“锁定”参考信息:为每个主要角色创建一张清晰的参考图(面部清晰、光线均匀、着装完整),并用一份固定的文字描述(包含姓名、年龄、发型、服装)。在所有提示词中严格复制粘贴这份描述。此外,单镜头尽量只安排2-3个角色,避免人群场景导致人脸混淆。
- 有没有能直接处理完整剧本的AI电影制作工具?
- 有,Cinely等采用“剧本先行”路线的工具可以。你输入完整剧本,它能自动分镜、根据说话人构建角色、为角色分配参考形象、按顺序渲染场景并拼接成片,同时保留你的原始对话。这避免了手动为几十个片段复制粘贴角色描述的繁琐工作。但在选择这类工具时,需确认其是否能逐字保留对话、允许自定义分镜、支持固定面孔的数量以及渲染前的预览编辑功能。
Written with AI assistance and edited by the Cinely Team.