AI 视频最容易让人兴奋的地方,是一句话就能出现画面。也正因为如此,很多演示停在“生成一段很漂亮的视频”。但短剧不只需要漂亮画面,它还要让观众知道谁在做什么、为什么继续看、镜头之间是不是同一个故事。
有些模型按文字直接生成动态画面,这通常叫文生视频;有些模型从一张静态图出发,让画面产生运动,这通常叫图生视频。文生图则是用文字生成角色或场景的静态画面,常用来先确定视觉方向。知道这几种输入的区别,我才能决定先让模型帮我想象画面,还是让已经选定的画面动起来。
我想把 AI 视频当成一种新的制作能力来研究。我的目标不是先做一部完整短剧,而是先设计其中一个 30 秒开场片段:人物能认出来,动作能看懂,结尾留下一点悬念,让人愿意看下一段。它只用来验证一个开场场景的叙事和制作路线,不代表已经做出一集短剧,也不能单凭它判断连续剧情是否成立。
这里的 30 秒是一个练习规模,不代表行业标准。下面是一套我会采用的制作路线,目的是说明样片怎样规划,不是声称已经完成的短剧实测。

第一步:先有一个能拍出来的故事

短视频时长很短,但不等于故事也可以没有因果。先写出三句话:
  1. 主角想得到什么?
  1. 什么事情挡住了他?
  1. 结尾出现什么变化,让观众想知道接下来会怎样?
例如:一个夜班外卖员把送错的包裹送回去,门后却传来自己的声音。这个设想还不能直接拿去生成视频,但至少有角色、动作和转折。下一步要把它拆成能被观看的镜头,而不是继续往故事里塞更多设定。
我会给每个镜头指定一个功能:交代环境、呈现动作、给出反应、留下信息。30 秒可以先尝试 4 到 6 个镜头,每个镜头只承担一个主要变化。镜头越多,生成、筛选和保持连续性的工作也越多。

第二步:先固定角色,再让角色动起来

如果每个镜头都从文字重新生成,角色的脸、衣服、光线和构图可能会变。文生图适合快速探索人物外观、场景气氛和关键画面,但每张图的变化也可能把它带向不同版本。
我会先做一张角色参考图,写一段简短角色设定:年龄感、发型、服装颜色、随身物件和情绪气质。再做一张主要场景参考图。制作时把这两张图当作固定锚点,不在每个镜头里重新发明人物。
这不是保证角色完全一致的魔法。参考图只是提供稳定的视觉线索,镜头变化、遮挡、表情和模型能力仍会影响结果。我的检查项会包括:脸部特征、衣服关键细节、人物所在位置、主要光线、道具是否突然换样。
以“包裹放到门口,听见声音后回头”为例,我会先把它拆成短镜头,而不是要求一个生成任务同时完成整段表演:
镜头
观众需要看到什么
生成方式的起点
连续性锚点
1
夜晚楼道和主角抵达
场景参考图做图生视频,轻微推进
同一件外套、同一盏冷色楼道灯
2
包裹被放在门边
关键帧转图生视频,动作保持简单
包裹颜色与门牌位置
3
主角听见门后声音
近景或静止画面,声音后期处理
主角站在门的同一侧
4
主角回头,镜头停在表情
图生视频描述动作和镜头运动
面部、衣服和画面方向
5
门内出现异常线索
单独设计一张新关键画面
通过声音或道具接回前一镜头
这张表是分镜草案,不是生成结果。它让我先看见生成任务需要什么素材,也能在某个镜头失败时只重做那一段。
角色参考图的提示词,我会先控制在角色与风格信息上:
我会先选定一张可用参考,再把同一份人物描述带到分镜记录里。若模型支持参考图或角色一致性控制,就同时按其当前功能文档使用;如果不支持,提示词本身无法保证多个镜头稳定一致。

第三步:文生视频和图生视频分工

这两种名字描述的是输入不同。文生视频从文字生成画面,适合探索氛围、补充过场或尝试还没有定型的构想。图生视频则从一张图出发,让它产生运动;当我已经有了构图和角色参考,它更适合继续探索这个画面如何移动。
Runway 对其 Gen-4.5 的官方说明同时列出 Text to Video 与 Image to Video,并建议图生视频提示词重点描述运动,文生视频提示词则同时交代视觉元素和运动。快手发布的可灵 3.0 系列覆盖文本、图像、音频与视频输入输出。具体可用能力、时长与费用会随产品版本变化,我会在真正制作时再查当期说明。
我的选择顺序会是:先确定镜头里必须保留的东西,再决定生成方式。如果环境和角色都还没想清楚,先用文生图或文生视频探索方向;如果我要稳定一个已经选中的画面,就用图生视频尝试动作;如果工具支持参考素材或多模态控制,再按它的当前文档调整输入。

一个图生视频提示词骨架

我会从画面里已经有什么开始,主要写动作和镜头变化:
这个模板不是通用的“咒语”。如果模型把动作顺序理解错,我会把它拆成更短的动作或更少的镜头;如果画面一直改动角色,就退回到单镜头测试,而不是叠加更多形容词。

第四步:剪辑承担故事连续性

模型负责生成镜头,剪辑负责让镜头变成观众读得懂的因果。即使每一段单独看起来不错,拼起来仍可能出现动作跳跃、人物位置不连贯、情绪没有落点的问题。
因此,第一版样片只需要保住三个连接:角色在同一个故事里,动作有前后顺序,结尾回应开头的问题。字幕应该帮助理解,而不是补救完全看不懂的画面。声音、停顿和镜头顺序也会改变观众对同一段素材的理解。
如果我需要生成配音或音乐,会把它们作为独立资产管理,记录素材来源、使用条件和授权状态。画面里出现的真实人物、品牌、影视角色或他人作品,也不因经过生成模型就自动变成没有权利问题的素材。

我会怎样判断第一条片是否完成

我不会用“生成了多少段”衡量这次练习。更实用的是一页检查单:
  • 不看说明,观众能否说出主角在做什么?
  • 镜头之间是否保留关键人物特征和道具?
  • 每段画面是否服务于动作或转折,而不是只做装饰?
  • 失败镜头是靠剪掉解决,还是必须回到提示词重做?
  • 我记录了生成次数、人工挑选和剪辑花费吗?
  • 用到的模型、素材和声音是否能按其现行条件使用?
如果前四项过不了,我会缩小故事,减少角色、场景和动作;如果后两项没有记录,样片就只能证明“画面能生成”,还不能证明这条流程适合持续制作。

我的下一步不是批量生产

AI 视频让我看到的是一种新的分工:文字和图片帮助我明确视觉方向,视频模型探索动态表现,剪辑重新建立叙事顺序,人负责挑选哪些结果值得保留。
文生图、文生视频、图生视频看起来像三个创作按钮,实际需要的是一个连续的制作判断。先让故事足够小,再让角色和镜头有锚点,最后看剪辑能不能把观众带到结尾。
我想先把一条短片做得清楚,再考虑能不能扩大成短剧系列。真正值得复用的不是一段提示词,而是我能解释每一步为什么存在、失败后应该退回哪一步的制作地图。

参考资料

资料核对日期:2026-09-30。本文的 30 秒开场片段为流程示例,需经实际制作后再补充耗时、成本和效果记录。
Loading...