想象一下,你脑海中那个跌宕起伏的赛博朋克悬疑故事,或者轻松搞笑的都市日常,现在只需要一台电脑,就能在几个小时内变成画面精美、配音生动的漫剧视频。这不是科幻电影里的场景,而是目前圈内正在跑的 AI漫剧自动化工作流。今天就把这套从剧本到成片的完整实操经验全盘托出,不藏私,直接带你跑通全流程。

剧本与分镜:用大模型搞定故事骨架

做漫剧第一步不是直接画图,而是写剧本和分镜。很多人一上来就写画面提示词,结果故事逻辑稀碎。我习惯用 Kimi 或者 通义千问 来梳理故事线。先让大模型帮你把大纲写出来,然后再拆解成具体的分镜脚本。

分镜脚本的核心是“画面描述”和“镜头语言”。你可以直接复制下面这段提示词,让大模型帮你生成标准化的分镜表格:

你现在是一位专业的影视分镜师。请根据我提供的故事大纲,将其拆解为15个分镜。每个分镜需要包含以下字段:镜号、景别(特写/中景/全景等)、画面内容(详细描述人物动作、表情、环境光影)、镜头运动(推/拉/摇/移/固定)、台词/旁白。请确保画面描述具有强烈的视觉冲击力,适合转化为AI绘画提示词。我的故事大纲是:[在此输入你的大纲]

拿到分镜后,我们需要把“画面内容”翻译成 Midjourney 或 Stable Diffusion 能懂的提示词。这里有个小技巧:把人物特征、环境、光影、摄像机角度分开写,用逗号隔开,不要写成一长串没有逻辑的句子。

角色设计与一致性控制:打破换脸魔咒

做连续剧最怕主角下一集就换脸。在 AI漫剧自动化工作流 中,角色一致性是重中之重。目前最稳妥的方案是使用 Midjourney 的角色参考功能,或者 ComfyUI 的 IPAdapter 节点。对于新手,我强烈推荐 Midjourney 的 --cref 参数,操作门槛最低。

首先,你需要生成一张非常满意的主角正面全身照,作为“种子图”。拿到这张图的链接后,在后续生成所有包含该角色的分镜时,都要带上这个链接和权重参数。

一个年轻的赛博朋克黑客女孩,穿着黑色机能风外套,戴着发光的战术护目镜,站在霓虹灯闪烁的暗巷里,雨水打湿了她的头发,电影级光影,赛博朋克风格,8k分辨率,极高细节 --ar 16:9 --cref [你的种子图链接] --cw 100

注意 --cw 100 这个参数,它表示参考整张图片的特征(包括脸和衣服)。如果你只想保持脸部一致,想换衣服,就把权重改成 --cw 0。另外,每次生成后,挑出最像的一张,替换掉旧的种子图,这样能防止特征在多次生成后逐渐偏移。

动态生成与运镜:让静态画面产生电影感

静态图生成好之后,接下来就是让画面动起来。目前做图生视频,可灵AI 和 即梦AI 是性价比和效果最好的两个选择。把 Midjourney 生成的图喂给它们,加上运镜提示词,就能得到几秒的高质量动态素材。

这里最大的坑是“动态幅度”。AI 视频模型对物理规律的理解还不够完美,动作幅度太大极易出现肢体扭曲或脸部崩坏。实操时,一定要控制运镜和人物动作的幅度。

电影级镜头,缓慢向前推镜头,女孩微微转头看向镜头右侧,眼神警惕,头发和衣服随着微风轻轻飘动,背景霓虹灯闪烁,景深效果,高帧率,平滑运动,物理规律真实

提示词里多用“缓慢”、“微微”、“轻轻”这类限制幅度的词。如果是大场景,可以多用“平移”、“环绕”等镜头运动词汇,减少人物本身的复杂动作。生成时记得开启“专业模式”或“高画质”选项,虽然耗费积分多一点,但成片质感完全不是一个级别。

配音剪辑与成片:音效人声完美融合

素材都齐了,最后一步就是进剪辑软件组装。剪映专业版 足够应对90%的需求。配音方面,如果不想自己录,可以使用 魔音工坊 或者 剪映自带的文本朗读。选声音时,注意语速和情绪要贴合角色设定,悬疑剧选低沉冷静的,搞笑剧选活泼跳脱的。

漫剧的灵魂其实在音效(Foley)。很多新手剪辑只铺BGM和人声,画面看起来就像PPT。你需要根据分镜,手动添加脚步声、衣服摩擦声、环境音(如雨声、风声)、甚至是技能释放的音效。

  • 环境音垫底:全程铺一层微弱的场景白噪音,让空间感更真实。
  • 动作音效卡点:人物转身、拔枪、开门,音效必须和画面动作严格对齐,误差不要超过两帧。
  • BGM起伏:高潮部分推高音量,对话时自动闪避(降低音量),剪映里开启“音频闪避”功能就能一键搞定。

把视频、人声、音效、BGM分轨对齐,导出时选择 1080P 或 4K,码率拉高,一部完整的AI漫剧就大功告成了。

常见问题

在AI漫剧自动化工作流中,如何保持角色在不同分镜中的长相一致?

核心是使用角色参考功能。在 Midjourney 中,先生成一张标准的角色正面图作为种子,然后在后续所有提示词末尾加上 --cref [种子图链接] --cw 100。如果衣服需要变化,将 --cw 改为 0 即可只固定脸部。建议每生成5张图就替换一次种子图,防止特征衰减。

生成的动态视频经常出现人物脸部崩坏或肢体扭曲怎么解决?

这是因为动作幅度超出了AI模型的物理理解极限。解决办法是做减法:在提示词中加入缓慢、微小动作等限制词,尽量用镜头运动(如推、拉、摇)来代替人物的大幅度肢体动作。此外,尽量使用首尾帧控制功能,指定运动的起始和结束画面,能大幅降低崩坏概率。

新手跑通这套AI漫剧工作流大概需要多少预算和时间?

预算方面,Midjourney 基础会员加上 可灵AI 或 即梦AI 的会员,每月工具成本在200元以内。时间方面,熟练后制作一部3分钟(约30-40个分镜)的漫剧,从写剧本到最终剪辑导出,大概需要 6-8 小时。前期摸索阶段可能需要一两天。