
1. 先想清楚短剧工作流到底要解决什么问题1.1 短剧生产场景下的真实需求我最早接触“短剧”这个词是从短视频平台的剧情号、漫画推文、小说推广类账号开始的。这类内容的典型特征是剧本短、角色固定、分镜数量大、更新频率高。你不可能像拍电影那样花几个月去做一集但观众对角色一致性的要求一点都不低。一个女主的脸上一集是这样下一集换了个人评论区马上炸。所以“短剧工作流”本质要解决的是三个字一致性。角色长相一致服装风格一致画面风格一致。加上短剧的产出量很大一套能批量化出图、批量出视频的流程才是真正能落地的方案。ComfyUI 刚好是这个领域里最合适的载体。它不像传统图像软件那样一个个手调而是把整个流程拆成节点画布上拉一根线就能把“文生图—修脸—换背景—图生视频”全部串起来。我第一次用 ComfyUI 做短剧角色踩了不少坑。后来把整套链路理顺之后效率提升非常明显。以前一天做 10 张图就累得不行现在一条龙跑下来一个角色能稳定出 30 张不同角度的图还能直接推成小段视频。这篇就分享我实际搭出来的短剧工作流以及里面每个关键环节的取舍。1.2 为什么是 ComfyUI而不是其他工具短剧工作流市面上也有不少在线工具比如用网页端生图、再用网页端生成视频。好处是省事坏处是分镜一多、角色一多就乱套了不同平台的角色模型不一致风格不统一修改一版提示词要重新复制粘贴半天。ComfyUI 的价值在于“整条链路在一张画布上可视化”。你可以把角色设计、背景生成、分镜扩写、视频生成整个流程做成一个工作流文件下次换个剧本直接套用。某个环节效果不好只需要替换一个节点不用从头再来。这种“工作流即模板”的模式让制作成本大幅度下降。而且 ComfyUI 的社区生态非常强。做角色一致性有 IPAdapter 类节点有 InstantID类似工具有各种角色 LoRA 训练方案做控制有 ControlNet 全家桶可以锁姿势、锁深度、锁线稿做视频有 AnimateDiff、Wan2.2 系列等本地视频模型可以接入。短剧制作需要的每一个环节几乎都有对应节点可以接上。1.3 一条龙工作流的模块拆分在我实际搭建时把整套工作流拆成了五个模块剧本与分镜模块、角色设计模块、场景生成模块、关键帧视频模块、后处理输出模块。剧本与分镜模块主要负责把一段剧情脚本转成一个个画面描述这一步现在可以用大模型来完成把小说段落、短剧台词喂给大模型让它输出“场景 人物 动作 景别”的结构化描述再转成 ComfyUI 能用的提示词。角色设计模块核心是定角色。我会先设计一个基础立绘再通过 LoRA 或参考图方案把这张脸锁住。这个模块一旦做好后续无论出多少张图角色都不会“串脸”。场景生成模块负责把剧本里的地点描述转成背景图。短剧场景一般不会太多但每个场景要能复用。所以我会单独生成一批场景底图后续做图生视频的时候直接用。关键帧视频模块是整条链路的重头戏。这里用到的是图生视频的思路把单张关键帧喂进去让模型把画面动起来。可以配合首尾帧控制让两个画面之间有转场逻辑而不是毫无规律地乱动。后处理输出模块负责把生成的视频片段统一处理成适合发布的尺寸和时长。比如批量剪辑、加字幕、补帧、抽帧检查。这个模块我用 ComfyUI 的节流输出加外部 FFmpeg 配合完成也可以用工作流里自带的视频拼接节点来做。2. 环境部署先把“地基”打稳2.1 本地部署还是用整合包我见过太多人在工作流还没跑起来之前就先被环境搞崩溃。ComfyUI 本身的安装并不算难官方仓库 clone 下来装依赖就能跑。但这只是最基础的原生环境真正做短剧工作流需要装大量自定义节点、模型文件、ControlNet 配置手动维护起来很痛苦。所以我的建议是刚上手的人直接用秋叶整合包类工具。这类整合包把 Python 环境、依赖、常用插件、模型下载器都打包好了装上就能跑。我自己最开始踩坑无数换了整合包后才算真正把时间花在“做图”上而不是“配环境”上。有一定基础之后再考虑自己从官方仓库部署。自己部署的好处是干净、可控不会有整合包预置的一堆用不上的插件占用显存和内存。我在 Ubuntu 服务器上就用了官方方式因为一台机器要长时间跑批量任务越干净越稳定。2.2 硬件配置的基本门槛做短剧工作流对硬件的要求比单纯文生图要高不少。如果只用 SD1.5 系模型出图片6G 显存勉勉强强能跑但一旦接入视频生成比如 Wan2.2、AnimateDiff显存不够就只能看着报错发呆。我自己的主力机器是 12G 显存的显卡做一些短视频片段是够用的。如果要做长镜头或者用更高分辨率的视频模型建议 16G 以上显存。内存 32G 起固态硬盘尽量留 200G 以上的空间装模型。ComfyUI 对 CPU 要求其实不算太苛刻但生成视频时CPU 会参与解码和预处理正常型号就行没必要追求特别高端的 CPU。如果是 Ubuntu 环境还要注意一点显卡驱动和 CUDA 版本要匹配。ComfyUI 的 PyTorch 版本对 CUDA 版本有要求装错了会出现“Torch not compiled with CUDA enabled”之类的提示。遇到这类问题千万不要自己瞎猜先在终端里执行python -c import torch; print(torch.cuda.is_available())检查 CUDA 是否可用一步到位排查。2.3 模型选择与下载规划短剧工作流里模型文件占用的空间非常大。如果一开始不做规划随便下载很快硬盘就满了。我按用途把模型分成三类第一类是底模也就是 checkpoint 大模型。做漫画短剧用二次元风格底模做真人短剧用写实底模。第二类是辅助模型包括 LoRA、ControlNet、IPAdapter 模型。LoRA 用来锁角色ControlNet 用来锁动作和构图IPAdapter 用来做参考图迁移。第三类是视频模型比如 Wan2.2 系列负责把静态图变成动态视频。硬盘空间紧张时建议只保留一个主力底模不要什么都想试。ControlNet 模型按需下载比如短剧里人物经常要做指定动作那就必装 OpenPose 类模型如果经常固定机位拍场景深度类模型优先级更高。视频模型体积大、显存占用高下载前先确认自己显卡带不带得动不然下载完发现跑不动白白浪费时间和硬盘空间。2.4 必装插件清单ComfyUI 的生态优势很大程度来自自定义节点。插件装太多会拖慢启动速度还会增加节点冲突概率。我习惯保留一套“够用不大全”的插件组合ComfyUI Manager管理自定义节点安装、更新、检查冲突都靠它。ControlNet 辅助节点配合各类 ControlNet 模型使用。IPAdapter 相关节点做角色一致性是短剧工作流的重点插件。视频模型相关节点用于接入 Wan2.2 等视频生成模型。图像后处理类节点包括人脸修复、放大、抠图等对成片质量影响很大。FFmpeg 相关节点或外部工具处理视频拼接、抽帧、转码。插件装完后建议先跑一次默认工作流确认基础环境没问题再开始装其他模型。不少新手一上来就装 20 多个自定义节点结果某个节点更新后把整个 ComfyUI 搞崩了连报错都不知道从哪查起。3. 角色设计怎么让角色从头到尾不“串脸”3.1 角色一致性设计的几种主流方案短剧最怕的就是角色脸不一致。要让同一张脸在不同分镜、不同场景、不同表情下都保持稳定最靠谱的方案是训练角色 LoRA。训练 LoRA 的方法不难准备 15 到 30 张角色不同角度的图片打标后丢给训练脚本跑一阵子就能得到一个小体积角色 LoRA 文件。之后在 ComfyUI 里加载这个 LoRA生成图像时角色特征就会稳定很多。不过训练 LoRA 对新手来说有一定门槛而且训练集质量差的话效果还不如不训练。所以我一般会建议先试 IPAdapter 的参考图方案。它的思路是把一张参考图喂给模型让生成结果在风格和特征上向参考图靠拢。好处是设置简单、不用训练坏处是稳定性没有 LoRA 那么强换角度时偶尔会崩。我在实际做短剧时经常是两者结合先训练一个角色 LoRA再在 LoRA 基础上加一点参考图约束双保险。这样既能保证五官大体一致又能保留角色的辨识度。3.2 搭角色设定卡的正确姿势很多人在设计角色时直接从“生成一张图”开始这是不对的。短剧角色需要多角度、多表情、多服装的统一设定所以我会先做一张“角色设定卡”。建议用 2x3 的拼接方式同一角色生成 6 个不同的姿势和表情正面立绘、侧面、背面、高兴、愤怒、哭泣。拼接后形成一张长图作为这个角色的“标准像”。之后所有分镜图都以这张标准像为参考。具体操作时可以在 ComfyUI 里建立一个“角色设计模板工作流”加载角色 LoRA设定固定 seed然后通过修改提示词里的表情、动作关键词批量生成多张图再用图像拼接节点合成一张设定卡。这样后续每个分镜生成时都参考这张大图角色一致性会好很多。3.3 避免“脸崩”的几个细节脸崩是角色生成里最常见的问题。同一个角色换一个角度就变成另一个人或者是眼睛、嘴巴出现扭曲。我的经验是第一用带人脸修复的后处理节点第二尽量保持生成分辨率不要过低控制在 512 到 768 之间出初始图再通过高清放大到 1080P 左右第三提示词里明确指定面部特征但不要堆砌太多矛盾的关键词。另外生成多张候选图时一定要一张张看不要盲目相信“批量出图都是好的”。很多工作流里的“刷脸”环节第一轮可能只有三分之一能用。我会先跑一批选择最满意的角度作为基准图再围绕这张图图生图而不是每张图都从随机噪声开始生成。4. 核心实操从分镜脚本到视频成片4.1 把剧本变成画面提示词短剧的剧本通常是一段文字可能三五句话就是一个镜头。要把它变成 ComfyUI 能理解的提示词关键是提炼四个要素人物、动作、场景、景别。比如剧本写“女主在咖啡厅里生气地看向窗外”转成提示词就是“女主角坐在咖啡厅靠窗位置生气表情看向窗外中景室内暖光浅景深”。我不会自己手动逐条写而是用大模型批量转写。把一个短剧脚本丢进去让大模型输出结构化分镜列表包含每镜的画面描述、镜头运动方式、景别建议。然后再通过一个转换脚本把分镜描述拼接成 ComfyUI 提示词格式。这里有个经验提示词里不要堆砌太多无关修饰词。短剧画面风格统一很重要所以通常把风格描述放进正向提示词的固定前缀里比如“电影感、高清、精致光影、真实细节”前面的变量部分只留给人物、动作、场景。这样整部短剧的画面风格才会保持一致。4.2 分镜关键帧的批量生成有了分镜提示词之后下一步就是在 ComfyUI 里批量生成关键帧图。这一步我会复用角色 LoRA、IPAdapter 参考图以及背景场景底图确保每一帧图的角色和背景都能对得上。操作流程是先在“文生图”节点里加载基础模型和角色 LoRA把固定前缀和分镜变量拼接成最终提示词设定好宽高比短剧一般用 9:16 竖屏然后批量跑图。生成结果如果哪一张不满意单独修图不用全部重跑。做完这一步通常会得到几百张分镜图。千万不要直接进入视频生成阶段一定要先人工过一遍把明显换脸、构图错误、穿帮的图筛掉否则这些错误会直接复制到视频里后期返工成本极高。4.3 图生视频的核心操作短剧视频生成的常见方式是把关键帧图喂给视频模型让画面“动起来”。本地方案我用的是 Wan2.2 系视频模型工作流节点里加载视频模型把输入图连接到入口设置帧数、帧率、采样步数就能生成一段短视频。运行参数上我做短剧一般用 5 到 10 秒一段帧率 16 到 24 之间。分辨率太高很吃显存通常先用低分辨率生成再补帧放大。生成视频时运动幅度参数很关键幅度太大会导致画面变形人物五官漂移幅度太小又像静止画面。我的做法是先跑 2 到 3 段测试找到当前场景最合适的运动幅度后再批量跑。图生视频生成时还会有个细节首尾帧控制。如果想让两段视频之间有个自然的衔接可以把第一段的最后一帧作为第二段的第一帧。这时候需要在工作流里把上一段生成的视频末尾帧提取出来再接入下一段生成流程。4.4 视频帧生成与补帧技巧短剧要发布到短视频平台流畅度很关键。本地视频模型生成的帧率通常不高看起来会一顿一顿的。我的解决方案是低帧率生成再用补帧工具升到 30 帧或 60 帧。ComfyUI 里可以接入 RIFE 类补帧节点它能根据前后帧计算出中间帧让动作更平滑。实际操作时我一般先生成 12 帧或 16 帧每秒的原始视频再用 RIFE 补帧到 30 帧每秒。补帧之后视频体积会增加画面也会出现一些果冻感所以补帧之后建议再用视频锐化节点处理一遍。还有一个小技巧短剧字幕是后期加的还是直接烧进视频里会影响生成效果。如果字幕直接烧进画面视频生成模型会把字幕也当成人物的特征容易在运动时出现文字扭曲。所以我的习惯是字幕永远后期加不在生成阶段让画面里出现任何文字。4.5 短剧特效与转场处理短剧视频总会需要一些简单的特效比如放大、缩小、头发飘动、光线闪烁。这些如果全交给视频生成模型去做会出现不可控的畸变不如用“图生视频 关键帧重绘”的组合方案先做一段基础动作再对需要特效的帧局部重绘把特效元素画进去。转场也是一样。短剧经常会用“闪白”“推近”“旋转”这类转场效果如果生成模型不支持特定运镜我会在 ComfyUI 里先用图像变换节点做画面渐变再导出成视频。比如要让画面从上一幕推到下一幕就先对两张关键帧做缩放和透明度插值形成转场动画再接入后续的其他视频片段。5. 常见问题与排查技巧实录5.1 “节点在执行过程中发生错误”怎么排查用过 ComfyUI 的人大概率见过红色报错框写着“节点在执行过程中发生错误 # ComfyUI error report”。我第一次看到这串提示时紧张得不行以为模型全坏了。后来总结出规律的排查顺序先看控制台输出是模型路径问题、显存溢出还是某个自定义节点缺失。如果报错里出现CUDA out of memory就是显存不够了降低分辨率或者减少 batch size如果报错里出现No such file or directory就是模型路径写错了如果报错里出现module has no attribute通常是对应插件版本太旧需要更新。还有一点容易被忽略网络上下载的工作流模板里面用到的自定义节点你本地没装打开时会有一堆红色报错。解决办法是用 ComfyUI Manager 一键安装缺失节点装不上的再手动处理。5.2 Wan2.2 生成视频只有一秒怎么办有段时间我天天被这个问题折磨Wan2.2 生成出来的视频只有一秒长度完全没法用。后来去翻了源码逻辑才明白视频长度不是随便设置的它受帧数、帧率和模型内部限制共同决定。如果你设置 16 帧、16 帧每秒自然只有一秒。解决思路是增加总帧数。比如想要 5 秒视频、16 帧每秒就需要 80 帧。但注意帧数增加后显存占用直线上升12G 显存跑 40 帧都吃力。我的折中方案是先生成 40 帧的 2.5 秒片段再通过补帧拉长到 5 秒这样显存压力和画面流畅度都能兼顾。5.3 生成视频动作不一致前后逻辑对不上短剧里人物动作是从 A 到 B结果生成出来的视频人物先走到左边再跳回右边看起来完全不受控。这个问题我刚遇到时也一头雾水。后来明白视频生成模型虽然能理解“运动”但它并不理解你想要的“因果关系”。对策就是靠关键帧强约束。如果动作跨度太大别指望一个模型直接生成整段而是把动作拆成两到三段每段单独生成段与段之间用首尾帧衔接。比如“起身”“转身”“离开画面”拆成三个短视频最后在剪辑时拼起来动作逻辑就不会乱。5.4 k 采样器里的 cfg 到底什么意思很多新手在调参数时会看到 cfg 这一项完全不知道它是干什么的。它全称是 Classifier Free Guidance简单理解就是提示词对生成结果的引导强度。cfg 越大生成结果越贴合提示词但过头之后图像会变得过饱和、生硬甚至出现伪影cfg 越小生成结果越自由但可能完全跑偏。我在短剧工作流里一般把 cfg 设置在 4 到 7 之间。文生图阶段如果角色特征不明显可以适当升高 cfg图生视频阶段尽量保持低一点的 cfg让模型不至于因为提示词过强而过度扭曲图像细节。每换一个底模都要重新测试一次 cfg 范围没有一劳永逸的参数。5.5 常见问题速查表现象常见原因解决办法运行时报 CUDA out of memory显存不足降低分辨率、减少 batch size、使用低显存优化节点模型文件加载失败路径错误或模型损坏检查模型路径、重新下载模型文件插件节点报红色错误自定义节点缺失或版本不兼容用 Manager 安装缺失节点、更新插件视频生成只有一秒帧数设置过少增加总帧数或用补帧拉长时长生成视频人物动作乱跳运动幅度过大或缺少关键帧控制拆分动作、降低运动幅度、加首尾帧约束cfg 过大致画面过曝提示词引导强度过高降低 cfg 到 4 到 7 之间出图全是黑白或色偏模型精度问题或 VAE 未加载切换精度设置、加载匹配的 VAE 文件6. 一条完整短剧工作流的搭建示例6.1 从剧本到成片的节点链路很多教程喜欢直接甩别人分享的工作流文件给你但说实话直接用别人工作流时你会发现节点多到根本看不懂更别说调试了。我建议按自己的需求从零开始搭一条最小可用链路跑通后再一步步加东西。我搭短剧工作流时整条链路长这样第一步用“文本输入”节点写分镜提示词第二步用“检查点加载器”加载底模和角色 LoRA第三步用“CLIP 文本编码器”把提示词编码第四步用“空 Latent 图”节点设定竖屏分辨率第五步连接“KSampler”做采样设置步数和 cfg第六步用“VAE 解码”输出图像第七步用“人脸修复”节点修脸第八步用“图像放大”节点提升分辨率第九步把图像接到视频生成模型节点设置帧数和步数输出视频。别看这一条链路不长它已经把“文生图—修脸—放大—图生视频”全部串起来了。跑通之后再接 IPAdapter、ControlNet、补帧这些扩展节点逐渐变成完整工作流。6.2 批量生产的工程化实践工作流搭好之后短剧批量生产最大的问题是“管理”。几十个视频片段、上百张分镜图如果全部手动保存很快就会乱套。我的做法是在 ComfyUI 里给每个输出节点配置固定的输出路径分门别类保存。比如把图像输出到project/chars/、project/scenes/、project/keyframes/视频输出到project/videos/clip01/这种路径。外部再用批量脚本把视频片段按序号拼接配上字幕文件输出成片。这一步不需要很复杂的代码只要明白每个节点的输出路径是一个字符串变量就可以用简单的 Python 脚本统一管理。工作量能减少一半以上。6.3 拿现成工作流改出自己习惯我自己最开始也是从网上找大神的短剧工作流模板学起但直接导入后总发现很多冗余节点。有时候一个 Libar 节点链条特别长实际上根本用不到那么多功能。建议拿到别人的工作流后先跑通一遍再逐个节点点开看把不用的、看不懂的、影响速度的节点删掉。这个过程会让你快速理解工作流的原理。改完之后建议做一件事保存一个新模板命名规范一些比如“短剧-角色设计-带IPAdapter-v1”。以后每个新项目就从这些模板开始而不是从零搭工作流效率会高非常多。7. 最后再分享点实际操作总结用 ComfyUI 做短剧工作流这件事我最大的感受是不能一开始就追求“大而全”一定要从最小可用版本开始跑。先把单张角色图跑通再跑视频最后才串联整条链路。那些上来就导入几十个节点的大工作流只适合已经理解每个环节逻辑的人。另一个经验是多存档。每调好一版工作流就另存为一个新版本文件。改坏了就退回上一个版本完全不慌。项目文件夹里我常备v1、v2、v3这样递增的工作流文件最终版本稳定之后再回头清理历史版本。最后再分享一个小技巧。做短剧角色的时候我会单独存一组“种子库”。同一张构图、同一套提示词下固定一组 seed 值后期如果某一帧想重新生成直接用这个 seed 就能复现类似效果。视频生成时阶段性的成功画面也建议把当时的关键参数复制到说明文档里。这些参数整理多了自己就能总结出一套适合自己显卡条件的调参方案比照着网上的通用配置到处试要靠谱得多。