AI短剧量产实战:用Skill跑通连续制作工作流

在AI短剧赛道日益拥挤的今天,漫剧、古装、仙侠和都市情感几乎成为标配。B站UP主戴鼠弟选择了一条差异化路线——制作面向海外传播的美式青春校园剧。经过两天的高强度实测,他不仅完成了两集真人感AI短剧,更重要的是探索出一套可复用的连续制作工作流。本文将系统梳理其经验与避坑指南。
值得先说明的是,AI短剧是2024年以来伴随视频生成模型(如Sora、可灵、Vidu、Runway等)能力跃升而爆发的新兴内容形态。它借助文生视频、图生视频技术,将传统需要真人拍摄、场景搭建、后期制作的短剧生产成本大幅压缩。国内市场上,微短剧本身已是千亿级赛道,AI的介入进一步降低了内容供给门槛,使得各类题材迅速涌现并同质化。而海外市场(尤其是ReelShort、DramaBox等平台带动的北美短剧付费生态)则为出海内容提供了差异化空间,这也构成了作者选择美式校园题材的宏观背景。
为什么选择做美式校园剧出海
国内AI短剧的主流方向已经相当拥挤,与其在相似类型里内卷,不如换个方向尝试出海。作者选定美式青春校园剧的核心考量有两点:人物要有颜值更要有辨识度,场景要让观众一眼认出这是同一所学校。
剧情设计上刻意保持克制。第一集从女主视角认识校园和主要人物;第二集女主意外拍到校园风云人物Tiffany男朋友隐藏的一面,两人争执中发生意外灵魂交换。剧情不算烧脑,因为这一轮测试的重点并非讲一个复杂故事,而是先把角色、场景和连续制作流程跑通。
作者一针见血地指出:单独生成一个漂亮镜头不难,难的是到了第二集第三集,观众看到的还是同一批人、同一个校园和同一种画面风格。 这正是AI短剧从"能生成"到"能量产"的关键门槛。
事实上,"一致性"正是当前生成式视频最核心的技术瓶颈。扩散模型(Diffusion Model)在每次生成时本质上是从随机噪声逐步去噪成图,即便使用相同提示词,每次采样结果也会有差异。这就导致同一角色在不同镜头间面部、发型、服装漂移,同一场景的建筑结构随机变化。业界的应对手段包括角色参考图锁定(Reference/IP-Adapter)、LoRA微调、首帧控制、ControlNet结构约束等——理解这一点,才能读懂作者后文诸多操作背后的逻辑。
Skill:把验证过的经验变成生产资产
第一集完全从零开始,角色参考图、校园场景、人物声音、整体风格、故事版和分镜都要逐项确定。作者强调,真正花时间的不是点击生成,而是不断做出选择——女主长什么样、校园有哪些固定区域、不同角色用什么声音、画面偏青春偶像剧还是偏写实电影感。这些一旦不固定,后面的镜头就会一直"飘"。

第一集完成后,作者基于LibTV的Agent把已验证的角色设定、场景参考、风格规则和操作步骤整理成一个Skill。这里需要理解Agent与Skill的机制:Agent(智能体)是能够理解意图、拆解任务、调用多种工具并自主执行多步操作的AI系统;Skill则类似于可保存和复用的"技能包",将角色设定、风格约束、参考图和操作步骤打包沉淀。这与软件工程中的"配置即代码"、提示词工程中的"模板库"理念一脉相承——把一次性验证的经验固化为可迁移资产。
到了第二集,他只在对话框输入大概的剧情走向,调用Skill后Agent就生成了完整脚本,并把每个分镜的台词时长、景别、构图和运镜整理出来。
效果立竿见影:第二集拆成九个分镜,最终成片用了其中八个,大部分素材第一次生成就能使用,只有最后一个镜头多抽了一次。作者澄清了一个重要认知——效率提高不是因为AI突然变聪明,而是Skill复用了上一集已经确定的设定、参考图和约束条件,它不用重新猜角色是谁、校园长什么样、画面应该用什么风格。
换言之,Skill保存的是已经验证过的重复工作,而不是替创作者完成整部剧。人物设定、剧情方向和关键镜头,最终决定权仍在创作者手中。
AI人物设计:如何对抗同质化
人物不能全部交给AI决定。作者最初给女主的设定是"有点叛逆、很有主见的酷女孩",但Agent生成的几版要么太甜,要么像常见校园剧模板,都不是想要的感觉。

这里暴露了当前AI生成人物的通病:五官都很精致、皮肤也很干净,可几个人放在一起你很难记住谁是谁。 这种"均值脸"现象源于模型训练数据的分布偏好——模型倾向于生成统计意义上最"标准"、最"讨喜"的面孔,反而抹平了个性化特征。作者给出的对策是——设计主角时不要只写"漂亮""年轻""高中女生",而要把发型、服装、身体姿态、表情习惯,甚至她站在人群里的状态都描述得更具体。提示词越具体,越能把模型从"均值"拉向独特。
具体操作上,他使用故事版里的"锚点元素"功能,选中需要修改的人物,在输入框重新描述再生成。故事版帮助维持稳定,而真正需要改变角色时,决定权仍然在人手里。
AI短剧三大典型坑与解决方案
第一集没有第二集顺利,作者踩了三个典型的坑,这部分堪称全文最有价值的实操经验。
坑一:场景飘移
开头想用一段连续镜头介绍人物并浏览整座校园,实际生成时前一秒还在操场,镜头一移动建筑结构就突然变了,甚至进入不相关的环境。根源在于每个镜头只收到一句"美国校园",AI每次的理解都不一样。这正是前文提到的扩散模型"无空间记忆"特性的直接体现——模型并不知道上一个镜头拍的是哪里,也不理解建筑之间的真实空间关系。
解决方法是切换到画布工作流:第一步先生成整座校园的鸟瞰图,确定教学楼、操场、停车场、主入口的空间关系;第二步根据鸟瞰图生成九宫格参考图,把校园拆成不同区域和机位。作者的洞察很精准——鸟瞰图不会让AI突然拥有空间记忆,它的作用是给所有镜头提供同一个地理依据。 要表现连续空间,就别让每个镜头都从零开始。
坑二:动作方向错误
有个分镜要求闺蜜看着镜头做"嘘"的动作,实际生成时她手指朝向画面左侧、人也没看镜头。作者最初以为是视频模型没理解,回到画布工作流检查才发现——参考图里的动作方向本来就是错的。

由此得出一条排查原则:视频出问题不一定要马上重抽,可以先顺着生成链路往前检查——剧本是否写清楚、参考图是否正确、人物视线身体朝向和手势是否一致。如果上游已经错了,视频模型很可能只是把错误继续演了一遍。这其实契合了AI流水线中"垃圾进、垃圾出"(Garbage In, Garbage Out)的经典原则:在图生视频的链路里,图像是视频的输入锚点,输入端的任何缺陷都会被下游环节忠实放大。
坑三:参考图噪点太重
场景图和角色图使用leap image生成,遇到人物多、建筑细节复杂的画面时会出现明显数字噪点:过度锐化、HDR塑料质感、不自然的高饱和。单看一张图或许能接受,但作为参考图送进后续视频模型后,这些纹理问题会被放大成画面闪烁、质感飘移或前后帧不一致。这是因为视频模型在逐帧生成时会对参考图的高频细节做出不同解读,噪点这类不稳定信息在时间维度上会被"抖动"出来,形成肉眼可见的闪烁。
作者测试了两种处理方式。第一种是先生成线稿或素模再用nano banana重新渲染,但在真人感短剧测试中容易丢掉摄影质感,画面偏向3D动画。第二种是保留原图结构只做一次克制的画质清理——不改建筑、不换机位、不重新设计场景,只降低数字噪点、过度锐化、塑料质感和人工HDR感。实测第二种更稳定。
把经验沉淀为可复用工作流
第一集完成后,作者没有只保存最终视频,而是把角色设定、场景参考、声音、画面风格,以及上述解决问题的方法一起整理进Skill:连续场景要先建立全局参考、动作错误要检查上游参考图、复杂场景图进入视频模型前先做画质清理。这些才是下一集真正能复用的经验。

所有分镜完成后,作者直接让Agent进行初步剪辑并添加双语字幕,需要更精细的节奏、音效或调色时再导入专业剪辑软件。此外LibTV还有一个Skill Hub,可以调用其他创作者整理好的Skill,作者将其理解为"工作流模板库"——不能保证直接得到理想成片,但能让你从已验证的流程开始,不用每次面对一张白纸。Skill Hub的价值在于引入了社区协作机制,让个体的试错经验能够跨创作者共享,从而降低整个行业的重复摸索成本,这与开源代码库、Prompt社区的共享逻辑异曲同工。
结语:门槛不在模型,而在方法沉淀
做完两集,作者最大的感受是:AI短剧真正麻烦的不是生成一个漂亮镜头,而是人物、场景、声音和风格能不能一直稳定。 第一集慢一点很正常,因为你做的不只是一条视频,而是在建立后面每一集都会复用的资产和规则。
对新手的建议也很务实:不用直接挑战完整电影,可以先做一个30秒的连续场景,或先跑通一集只有两三个固定角色的短剧情。第一集完成后不要只留成片,把有效提示词、角色参考、场景地图和失败条件一起保存下来。第二集能不能更快更稳,才真正说明这套工作流有没有跑通。
正如作者所言——AI短剧的门槛未必是你用了哪个模型,更重要的是能不能把偶然成功的一次生成,整理成可以反复使用的制作方法。这一观点,或许正是当前AI内容创作从"玩票"走向"生产力"的核心分野。
核心要点
相关推荐

Understand Anything:代码变可交互知识图谱的AI Skill
Understand Anything是一个GitHub高星开源skill,能对任意代码库做静态分析,生成可交互知识图谱,支持Claude Code、Cursor、Copilot等主流agent,用自然语言提问并带路径引用,帮工程师快速读懂陌生代码。

Kimi K3发布:2.8万亿参数开源模型如何重塑AI性价比格局
月之暗面正式发布Kimi K3,2.8万亿参数、100万上下文、原生多模态开源模型。凭借KDA架构创新与超低成本,在编程、知识工作等基准测试中媲美GPT-5.6与Fable 5,重新定义AI竞赛性价比。

Herder:统一管理多个AI编码代理的开源终端神器
Herder是一款开源终端多路复用器,支持macOS和Windows,可统一管理Claude Code、Codex、OpenCode等多个AI编码代理。具备组织性、可监控性和任务持久性,退出终端也不中断,还支持手机远程重连。多代理用户必备工具。