拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AI视频制作全流程:从剧本分镜到剪辑合成的完整指南

AI视频制作全流程:从剧本分镜到剪辑合成的完整指南

1. 先搞清楚一条AI视频到底由哪些零件拼起来

很多人第一次听到“AI视频制作”,脑子里浮现的画面是:打开一个软件,输入一句话,点一下按钮,一条带剧情、有角色、有配乐、有转场的完整片子就出来了。我一开始也是这么想的,结果折腾了一整天才发现,这种期待本身就是最大的坑。真实的AI视频制作流程,更像是在组装一台模型——每个零件单独看都不复杂,但要把它们拼到一起还能跑起来,中间有大量需要手动衔接的环节。

一条完整的AI视频,拆开来看至少包含五个核心模块:剧本与分镜、视觉素材生成、动态化处理、配音与音效、剪辑与合成。这五个模块各自有对应的工具链,而且它们之间的衔接方式决定了你最终成片的效率和质量。我见过太多人卡在“画面生成了但动不起来”或者“动起来了但口型对不上”这类问题上,本质上就是没有提前想清楚模块之间的数据该怎么流转。

这篇文章要解决的问题很具体:让一个完全没有接触过AI视频制作的人,从零开始走通一条完整的生产链路。不管你是想做3D古风短片、动漫风格的漫剧,还是简单的口播视频,这套流程框架都是通用的。我会把每个环节的工具选型逻辑、参数设置思路、以及我实际踩过的坑都摊开来讲。你不需要有编程基础,也不需要会画画或者剪片子,但你需要有耐心——因为AI视频制作目前还不是一个“一键完成”的事情,它更像是一个需要反复调试的手工活。

提示:本文涉及的AI视频生成工具均为公开可获取的常规创作工具,所有操作均在合规范围内进行。涉及提示词的部分,我会重点讲设计思路而非具体敏感内容。

2. 剧本和分镜:别急着打开AI工具,先把纸上的事想清楚

2.1 为什么剧本阶段决定了后面80%的返工率

我刚开始做AI视频的时候,最大的毛病就是“边做边想”。打开AI绘画工具,先随便生成几张图看看效果,觉得不错再想下一步。这种做法在单张图片创作时问题不大,但放到视频制作里就是灾难。因为视频的核心是连续性——角色要一致、场景要连贯、动作要能接上。如果你没有提前规划好每个镜头的内容,后面生成出来的素材根本拼不到一起。

剧本阶段要解决的问题其实就三个:谁、在哪、做了什么。听起来很简单,但落到AI视频制作的具体场景里,你需要把这三个问题拆解到每一个镜头。比如“一个穿白衣的剑客在竹林里练剑”这句话,在剧本阶段就要拆成:镜头1是竹林全景,镜头2是剑客拔剑的特写,镜头3是剑花飞舞的中景,镜头4是收剑入鞘的远景。每个镜头对应一张关键帧图片,而每张图片都需要用提示词去精确描述。

我自己的习惯是用一个简单的表格来管理分镜,字段包括:镜号、画面描述、景别、角色状态、预计时长、对应提示词关键词。这个表格不需要多专业,用Excel或者飞书表格都行,关键是让每个镜头的信息都落在纸面上,而不是留在脑子里。

2.2 分镜脚本的写法:给AI看的和给人看的不是一回事

这里有一个很多人忽略的关键点:给人看的分镜脚本和给AI用的提示词是两套语言。给人看的分镜可以写“画面唯美、氛围感强”,但AI看不懂这种描述。你需要把“氛围感强”翻译成具体的视觉元素:是逆光还是侧光?是暖色调还是冷色调?是浅景深还是大景深?

举个例子,同样是“古风女子在月下抚琴”这个场景,给人看的分镜可能就一句话,但给AI的提示词需要拆成:主体描述(年轻女性、古装、长发)、动作描述(双手抚琴、微微低头)、环境描述(夜晚、满月、庭院、石桌)、光影描述(月光从左侧打来、面部有柔和阴影)、风格描述(3D渲染、中国古风、电影级质感)。这些要素缺一个,生成出来的画面就可能偏离你的预期。

我一般会在分镜表格里直接写好每个镜头的完整提示词,这样到了生成阶段直接复制粘贴就行,不用临时想。提示词的长度控制在50到80个词之间比较合适,太短了信息不够,太长了AI会抓不住重点。

2.3 角色一致性:从第一帧就要开始控制

角色一致性是AI视频制作里最让人头疼的问题之一。同一个角色在不同镜头里长得不一样,观众一眼就能看出来,整个片子的质感就崩了。解决这个问题的方法有几个层次:

最基础的做法是在每个镜头的提示词里都重复描述角色的核心特征,比如“黑色长发、白色汉服、腰间佩玉”。但这种方法只能保证大方向不跑偏,细节上还是会有差异。

进阶的做法是使用角色参考图。很多AI绘画工具支持上传一张参考图,让生成的新图片在角色特征上向参考图靠拢。我的经验是,先用提示词生成一张满意的角色定妆照,然后把这张图作为后续所有镜头的参考图。参考强度一般设置在0.6到0.75之间,太低了不起作用,太高了会导致所有画面都长得差不多。

还有一个技巧是固定随机种子。大部分AI绘画工具都支持设置seed值,相同的seed加上相同的提示词会生成相同的图片。虽然不能完全保证一致性,但至少能减少随机性带来的偏差。

3. 视觉素材生成:从文字到画面的关键参数怎么调

3.1 工具选型的底层逻辑:没有最好的,只有最合适的

市面上的AI视频生成工具大致可以分成三类:文生图工具、图生视频工具、一体化视频生成工具。这三类工具的使用逻辑完全不同,选错了工具会让你的工作流变得极其别扭。

文生图工具负责把文字变成静态画面,这是整个流程的基础。图生视频工具负责让静态画面动起来,比如让头发飘动、让水流起来。一体化工具则是输入文字直接输出视频,看起来最方便,但可控性最差,适合做简单的氛围短片,不适合有明确剧情和角色要求的项目。

我的建议是:如果你要做有剧情、有角色的视频,走“文生图+图生视频”的组合路线。虽然步骤多了,但每个环节你都能控制。一体化工具目前更适合做抽象风格或者风景类的短视频,角色一多就容易翻车。

3.2 提示词设计的核心框架:四层结构法

提示词设计是AI视频制作里最核心的技能,没有之一。我总结了一个四层结构法,基本上适用于所有主流的AI绘画和视频生成工具:

第一层是主体层,描述画面里有什么。包括角色特征、服装、动作、表情。这一层要具体到颜色、材质、款式,比如“白色丝绸汉服”就比“白色衣服”好,“微微侧头微笑”就比“表情自然”好。

第二层是环境层,描述主体所处的空间。包括地点、时间、天气、背景元素。比如“竹林深处、清晨、薄雾、石板小径”。环境层决定了画面的氛围基调。

第三层是光影层,描述光线方向和质感。这是很多人会忽略的一层,但它直接决定了画面的高级感。比如“逆光、边缘光、柔和阴影”和“顶光、硬阴影”出来的效果完全是两个档次。

第四层是风格层,描述整体的视觉风格。比如“3D渲染、电影级质感、中国古风、超高清”。风格层要放在提示词的最后,因为大部分AI工具对末尾关键词的权重分配会有所不同。

这四层加起来控制在60到80个词,用逗号分隔,不要写成完整的句子。AI工具对关键词的识别效率远高于对自然语言句子的理解。

3.3 参数设置:采样步数、CFG、分辨率的实际影响

除了提示词,AI绘画工具还有几个关键参数需要调整。我用一个表格来说明它们的作用和推荐值:

参数名称作用推荐范围调整逻辑
采样步数控制生成过程的精细度25-40太低画面粗糙,太高收益递减
CFG值控制提示词的遵循程度7-12太低AI自由发挥,太高画面僵硬
分辨率控制输出图片尺寸1024x1024起低于这个值细节丢失严重
随机种子控制生成结果的随机性固定值固定后可复现相同结果

采样步数我一般设在30左右,这是一个性价比比较高的值。CFG值要看具体工具,有些工具7到9比较合适,有些可以到12。分辨率方面,如果你的最终输出是横屏视频,建议生成1920x1080的图片;如果是竖屏短视频,生成1080x1920。分辨率不够的话,后面放大时会损失细节。

注意:不同工具的参数名称可能不一样,比如有的叫“迭代步数”有的叫“采样步数”,但底层逻辑是相通的。理解每个参数在控制什么,比记住具体数值更重要。

3.4 从静态到动态:图生视频的三种驱动方式

静态图片生成好之后,下一步是让它动起来。目前主流的图生视频工具有三种驱动方式:

第一种是运动笔刷,你手动在图片上画出希望运动的区域和方向,比如在头发上画一个向下的箭头,头发就会向下飘动。这种方式控制最精确,但操作最繁琐,适合做局部细节动画。

第二种是运动强度参数,你设置一个整体运动强度值,AI会自动判断画面中哪些元素应该动。这种方式最省事,但可控性差,有时候背景会莫名其妙地动起来。

第三种是轨迹控制,你指定某个物体从A点移动到B点,AI会生成中间的过渡帧。这种方式适合做镜头推拉或者物体位移。

我自己的习惯是:主体动作先用运动笔刷精确控制,环境动态用运动强度参数辅助。比如人物说话的场景,嘴部和头部的运动用笔刷控制,背景的树叶飘动用强度参数带一下。这样出来的效果比较自然,不会出现“整个人都在晃”的诡异感。

4. 配音、音效与剪辑:让画面真正变成“视频”

4.1 AI配音的选择:音色、语速、情感三个维度

画面动起来之后,如果没有声音,它依然只是一段“动态图片”。配音是让视频产生叙事感的关键。目前AI配音工具已经相当成熟,选择的时候主要看三个维度:

音色方面,男声、女声、少年音、老年音这些基础选项都有,但更重要的是音色和角色的匹配度。一个古风剑客配一个现代感很强的播音腔,观众分分钟出戏。我的做法是先用文字描述角色的性格和年龄,然后在配音工具里找最接近的音色,试听三到五个再定。

语速方面,默认语速通常是每分钟240字左右,但古风题材建议降到200字左右,给观众留出品味画面的时间。如果是快节奏的解说类视频,可以提到260字以上。

情感方面,现在的AI配音工具大多支持情感标签,比如“平静”“激动”“悲伤”“温柔”。不要小看这个功能,同一句话用不同情感读出来,效果天差地别。我一般会在剧本阶段就标注好每句台词的情感倾向,配音时直接选对应的标签。

4.2 音效和配乐:别让BGM盖过一切

音效和配乐是很多人会敷衍的环节,但恰恰是这些细节决定了视频的“完成度”。我的原则是:环境音效铺底,动作音效点睛,配乐控制情绪但不抢戏。

环境音效比如风声、雨声、鸟鸣、街道嘈杂声,音量控制在-25dB到-20dB之间,刚好能感觉到但不注意不到。动作音效比如脚步声、拔剑声、关门声,音量可以到-15dB左右,要清晰但不刺耳。配乐的音量一般控制在-20dB到-18dB,有人声台词的时候要自动 ducking 到-25dB以下。

配乐的选择要和画面风格统一。古风视频配电子乐不是不行,但需要很强的剪辑功力才能不违和。新手建议先从风格匹配的曲库开始选,等熟练了再尝试混搭。

4.3 剪辑合成:时间线、转场、字幕的实操要点

所有素材准备好之后,最后一步是在剪辑软件里把它们拼起来。这一步看起来最简单,但实际上有很多细节会影响成片质量。

时间线方面,每个镜头的时长建议控制在3到5秒。太短了观众来不及看清画面,太长了节奏会拖沓。对话场景可以适当延长到6到8秒,但要有景别变化来维持视觉新鲜感。

转场方面,新手最容易犯的错误是滥用花哨转场。叠化、划像、缩放这些转场偶尔用一次可以,但大部分镜头之间用硬切就够了。硬切最自然,也最不容易出错。只有在时间跳跃或者空间转换的时候,才需要用转场来提示观众。

字幕方面,如果是口播类视频,字幕是必须的。字体选择上,古风视频用宋体或楷体,现代视频用黑体或圆体。字号要保证在手机屏幕上也能看清,一般占画面宽度的80%左右。字幕出现的时间要和语音对齐,误差控制在0.2秒以内。

5. 常见问题与排查技巧实录

5.1 画面崩坏:角色变形、多手多脚、面部扭曲

这是AI视频制作中最常见的问题,几乎每个人都会遇到。原因通常是提示词冲突或者模型对某些姿势的理解不到位。排查思路是这样的:

先检查提示词里有没有相互矛盾的描述,比如同时写了“正面视角”和“侧脸”。然后检查分辨率是不是太低,低分辨率下AI容易把细节画糊。如果都没问题,尝试增加负面提示词,把“多余的手指、变形的手、扭曲的面部”加进去。最后的手段是换一个随机种子重新生成,有时候就是运气问题。

5.2 动态不自然:画面抖动、物体漂移、动作僵硬

图生视频阶段最常见的问题是动态不自然。画面整体抖动通常是因为运动强度设得太高,降到中等水平试试。物体漂移比如背景里的树莫名其妙地移动,这是因为AI把不该动的区域也判定为运动区域了,需要用运动笔刷把静止区域锁定。动作僵硬一般是关键帧太少导致的,可以尝试增加中间帧或者换一个运动模式。

5.3 音画不同步:口型对不上、音效延迟

音画不同步在剪辑阶段很容易修复,但如果是AI生成的口型动画对不上,那就需要在生成阶段解决。目前AI口型同步工具已经比较成熟,输入音频和人物面部图片就能生成对应的口型动画。如果对同步精度要求不高,也可以在剪辑软件里手动微调音频位置,前后移动几帧就能对齐。

5.4 常见问题速查表

问题现象可能原因排查步骤解决方案
角色每张图长得不一样缺少角色参考检查是否使用了参考图固定角色参考图和种子
画面模糊细节丢失分辨率不足检查输出分辨率提高生成分辨率
视频抖动明显运动强度过高检查运动参数降低运动强度
背景物体乱动运动区域误判检查运动笔刷设置锁定静止区域
配音和画面不搭音色或语速不合适试听对比更换音色调整语速
成片节奏拖沓单镜头时长过长检查时间线缩短镜头或增加景别变化

5.5 我踩过的三个印象最深的坑

第一个坑是忽略音频采样率。我一开始用AI配音工具导出的音频是48kHz,但剪辑软件的项目设置是44.1kHz,结果导出后音频出现了轻微的变调。后来统一成48kHz就没问题了。这个坑很小,但排查起来很费时间。

第二个坑是过度依赖一体化工具。我试过用一体化工具直接生成带剧情的视频,结果角色在第三个镜头就变成了另一个人,而且完全没法控制。后来老老实实回到“文生图+图生视频”的流程,虽然步骤多了,但每个环节都可控。

第三个坑是忘记备份中间素材。AI生成有随机性,有时候第一版效果最好,但你没保存,后面怎么调都调不回来了。现在我养成了习惯,每个满意的中间结果都单独存一份,标注好参数和种子值。

6. 关于效率和质量的平衡,我的一些实际体会

做AI视频这件事,最容易陷入的误区是追求“全自动”。市面上确实有一些工具宣称可以一键生成完整视频,但实际用下来你会发现,要么风格千篇一律,要么根本没法控制剧情走向。真正能拿得出手的作品,背后一定有大量的人工干预和反复调试。

我的工作流经过多次迭代,目前稳定在这样一个节奏:剧本和分镜占20%的时间,素材生成占50%,动态化和配音占20%,剪辑合成占10%。素材生成之所以占这么多时间,是因为需要反复抽卡——同样的提示词生成十次,可能只有两三次能达到可用标准。这不是工具的问题,而是目前AI生成技术的固有特性。

另外一个体会是,提示词工程的核心不是写得多花哨,而是写得足够具体。我见过很多人把提示词写成诗,什么“月光如水洒在青石板上”,AI根本理解不了。改成“夜晚、满月、石板路、月光从上方照射、地面有反光”,效果立刻就不一样了。AI需要的是视觉元素清单,不是文学修辞。

最后分享一个提高效率的小技巧:建立自己的素材库。把每次生成的好看的背景、道具、光影效果都分类存好,下次做新项目的时候可以直接调用或者作为参考图。我现在的素材库里有几百张分类好的图片,做新片子的时候至少能省掉三分之一的生成时间。这个习惯看起来不起眼,但日积月累下来,效率提升非常明显。

返回列表