一集 AI 短剧到底是怎么做出来的,逐个镜头讲

大多数讲这件事的文章停在"你输入一段提示词,它生成一个视频",而这跳过了全部的工作。一集不是一次生成,而是一个在任何一个镜头被生成之前就必须定好的结构,把这个结构做错,AI 短剧看起来就会像幻灯片
下面的数字来自这个产品里二十集已经做完的样片。每一集都是 60 秒、13 个镜头,分在 4 个场景里,有 4 到 6 个有名字的角色,加起来 260 个镜头。这不是什么宇宙定律,这是实际跑通了的东西,而它比一张白纸好用得多
一集的形状
第一个镜头 3 秒,之后每个镜头 4 秒或 5 秒。这不是风格上的癖好,这是钩子:让人停下来别划走的那个东西必须在第 4 秒之前出现,而一个 3 秒的开场会逼着剧本把它放在那里,而不是慢慢铺垫
60 秒里放 13 个镜头,意味着平均每个镜头不到 5 秒。一集里没有任何地方可以喘气,这是这个体裁本身,不是妥协。13 个镜头分在 4 个场景里,等于每个地点大约 3 个镜头,所以换场是一件真事,不是走个过场
| 是什么 | 数字 | 来自哪里 |
|---|---|---|
| 一集时长 | 60 秒 | 20 集样片完全一致 |
| 一集的镜头数 | 13 | 20 集样片完全一致 |
| 第一个镜头 | 3 秒 | 钩子,什么都还没解释 |
| 其余每个镜头 | 4 或 5 秒 | 第 2 到第 13 个镜头 |
| 场景数 | 4 | 每个地点大约 3 个镜头 |
| 有名字的角色 | 4 到 6 个 | 二十集加起来 83 个 |
| 提前规划的集数 | 每个样片 3 集 | 所以第二集已经有草图 |
| 写好的生成提示词 | 二十集共 780 条 | 每个镜头两条加运动 |
2026 年 8 月 18 日从这个产品里的二十个样片文件中统计得出。
用 H3 Max Turbo 生成试试这些工作发生的顺序
先有故事,而且很短。一个设定,然后是撑起它的四个节拍:开场、冲突、反转,以及让人想看第二集的钩子。四行字。这四行字如果无聊,什么模型也救不回来
第二步是定角色,这一步最多人跳过。每个角色在任何镜头被生成之前,先变成一张参考图,因为只有这张图能让第 11 个镜头里出现的还是第 2 个镜头里那个人。每次用文字重新描述一个角色,你每次都会得到一个不同的人
第三步是定场景,道理一样。一个靠描述而不是靠锁定的房间,每次有人走进去看起来都是另一个房间
最后才是镜头。到这一步才写镜头表,13 个,每个带着自己的画面描述、运镜、光、台词,以及它绑定的角色参考。然后才生成,而生成是整件事里最快的一步
通常出问题的三个地方
先生成再定角色。这是最大的一个。如果你边做镜头边定角色,就没有任何参考能把他们锁住,到第 9 个镜头主角已经换了个人。事后修就意味着大半集要重做
把两分钟的故事塞进 60 秒。节拍压不下去,只会变得赶,每个镜头都在解释而不是在呈现。如果这个设定需要更多空间,那它是一个三集的弧线,而不是一集更长的
到处都用贵的模型。一个交代环境的远景和一个人脸特写不需要同一个模型。远景用便宜的、人脸用贵的,是控制一集成本最大的开关,而观众根本看不出区别
生成这一步花多少钱
计费单位是一次生成,所以要记住的数字是一个镜头多少钱。一个 5 秒 720p 的镜头,用可选列表里最便宜的视频模型是 2.94 积分,最贵的是 82.78。同样的五秒,差 28 倍,而且是你逐个镜头选的
这个差距就是为什么选模型比你在成本上做的任何其他事都重要。这也是为什么你即将跑的这一次生成花多少,在你确认之前就写在生成按钮上:你定模型,你看着数字变,你来决定。不会有任何东西替你把还没跑的活报一个总价
免费账号开局 40 积分,不用绑卡,按最便宜的模型算是十三个 5 秒镜头。这足够你搞清楚自己写的东西行不行
还有问题吗
每一集都必须是 60 秒 13 个镜头吗
不是。这是二十集做完的样片最后落在的形状,不是规定。它是个好的默认值,因为它适配大家看这类内容的竖屏信息流,也因为 13 个镜头足够撑起 4 个场景而不会觉得哪一场被跳过了。故事需要的时候可以更长。
为什么第一个镜头要更短
因为让人不划走的那个东西必须已经发生了。3 秒的开场留不下铺垫的空间,这就逼着把有意思的东西挪到最前面。二十集样片里第一个镜头都是 3 秒,之后每个都是 4 或 5 秒。
能自己写故事而不是让它生成吗
可以,而且通常更好。剧本环节的作用是让你从一个设定快速到一张镜头表,不是把写作从你手里拿走。每一句台词、每一个节拍、每一个镜头都可以改,改一场戏只会重跑它涉及到的那几个镜头。



