一句话结论:AI 能把短视频制作里最耗时间的四件事——写初稿、拆分镜、出画面、配字幕——全部提速,但选题和最终把关必须你自己来。我把最近跑顺的一套流程按顺序写下来,每一步用了什么工具、卡在哪、怎么绕,都在这。
一、先理清顺序:6 步里只有 2 步必须靠人
很多人一上来就让 AI"生成一条视频",结果全是废片。正确的顺序是:选题 → 文案 → 分镜 → 画面 → 视频 → 配音合成。其中选题和文案定稿这两步必须自己拍板,剩下四步都能交给工具。
二、选题和文案:AI 只出底稿,人负责定稿
选题我用两个固定动作:先搜同题材里最近播放高的几条,看评论区在问什么;再从问题里挑一个自己能讲清的。文案先用豆包或 DeepSeek 出底稿,我给的要求就三条:口语化、每句话不超过 20 字、结尾留一个问题。
底稿出来后必须自己改一遍。AI 写的开头普遍"平",我会手动换成一句带数字或反常识的钩子,比如把"今天讲讲空调清洗"改成"空调停用前不洗这一次,来年吹出来的风都是黑的"。这一步不能省,省了完播率就掉。
三、分镜和画面:角色一致性是生死线
文案定稿后,把它发给 DeepSeek 或豆包,让它按"景别 + 画面内容 + 人物动作 + 情绪"输出分镜表,一般一条 60 秒的视频拆成 6-8 个镜头。
画面用即梦出图。这里有个我踩了两次的坑:角色形象必须先固定。做法是先出一张满意的角色图存好,之后每个镜头都把它作为参考图再生成,不然镜头一换人物就"换脸",观众直接出戏。场景图同理,先出全景定调,再逐镜生成细节。
四、图生视频:按 5-15 秒逐段生成
图出好后逐张喂给视频生成,每段 5-15 秒。两个经验:一是动作描述要具体,"人物缓慢转头看向窗外"就比"人物很自然地动一下"成功率高得多;二是别指望一遍过,一段生成两三次挑一条是常态,把这部分时间预算留出来。抽卡时优先挑口型和动作自然的,画面质量差一档可以接受,人物崩坏必须重来。
五、配音和合成:最后 20% 决定成片像不像样
配音用剪映的朗读功能,选沉稳一点的音色,语速调到 0.9 倍左右更耐听。合成也在剪映:配音对齐画面、自动识别字幕、字幕字号调到手机上一眼能看清,加个背景音乐(音量压到 20% 以下,别盖过人声)就能导出。发布前记得勾选平台的"AI 生成内容"标识,这是硬要求。
六、常见问题
Q:整套流程一条视频要多久?
熟练之后,60 秒以内的视频从选题到成片大约 2-3 小时,其中一半时间花在图生视频的抽卡上。
Q:必须用即梦吗?
不是。它胜在出图和图生视频能在一个工具里闭环,省去来回导素材。你也可以用豆包出图、剪映做合成,流程一样成立。
Q:AI 生成的画面能商用吗?
先看工具的授权范围,商用场景(比如投付费流量)确认清楚再用,别拿生成画面直接去做投放素材。
七、避坑提醒
- AI 标识必勾:主流平台都要求标注 AI 生成内容,漏标轻则限流重则下架,养成发布前最后检查的习惯。
- 画面别直接发:AI 图常见的多手指、文字乱码在手机小屏上不容易发现,成片后完整看一遍再发。
- 素材要归档:分镜图、配音、成片按项目存一个文件夹,一周后返工重剪时能救命。
- 别贪全自动:全流程"一键生成"的工具出片快,但同质化严重,账号做不起来,把它当草稿工具而不是终点。
整套流程的核心是把重复劳动交给工具,把判断留给自己。想顺一遍剪映侧的功能,可以看剪映 AI 实测;出图环节的工具页在即梦 AI,整个短视频工具箱见短视频剪辑工具箱。