一个人如何用 AI 完成一部动画:从剧本到成片的完整工作流
2025 年 8 月,AI 动画《瑞克和莫蒂勇闯刻板印象宇宙》在 B 站刷屏。作者「梦游牛油果」(刘士超)在 WaytoAGI 社区直播中,完整拆解了这部作品的幕后制作流程。本文适合想用 AI 做动画、但不知道从何下手的创作者阅读——刘士超反复强调的核心观点是:AI 只是提速工具,剧本和分镜才是作品的灵魂。
创作理念:先有表达欲,再谈工具
刘士超开篇就表明,这场分享的重点不在制作,而在制作之外的事情。「我觉得这个会在剧本层面上,或者在本身的观点的表达上会比制作这个事情要重要得非常多。」
他解释了自己为什么一直拖着不出教程:「就怕说这个东西会变成一种泛滥化的风格。」他举例说,网上看到切菜、小猫小狗做饭这类视频流量很高,但如果本身没有本质性的内容,做出来的东西会非常空洞。「在这个 AI 的时代的话,它让大家的工作确实是这个效率翻倍了,但是生产垃圾的速度其实也是翻倍的。」
他坦言自己做这部动画的动机很朴素:「刚好现在 AI 出来了,我能做一个动画片去骂他……我终于不用在网上骂人了,我可以做一个动画片来骂人,这感觉是挺舒服的,而且甚至就是被骂的人他是感受不出你正在骂他的。」
制作流程:剧本和分镜占 80% 的心血
刘士超把制作流程的核心总结为一句话:剧本和分镜站在制作里的最高阶层。「我可能会有百分之八九十的心血是花在这个上面的」,而 AI 在这部分帮不上太多忙。
「你从一个文字的信息量到一个视频的信息量,它中间其实跨越了一个无数的等级。」从文字拆分成分镜,分镜里色彩风格怎么定、人物说话几秒钟、空镜停留多长时间,都靠创作者自己的感觉。「AI 它其实是在这一块,它是没有帮到你的。」
他分享了一个关键经验:做动画之前,他请教过一位做动画专业的朋友,对方问他分镜是不是画不出来,他想了想说分镜全部画得出来。朋友告诉他,只要分镜画得出来就没有问题。「即便它是个静态的,你依然可以讲故事。」所以他的方法是把分镜切得足够碎,把所有能做的分镜全部做出来。
以追逐戏为例:「你从它从入画到它出画,整一个过程都必须要有……你把它给踹一脚,踹开,然后坐上去了,这又得做一个。然后他做的这个蟑螂跑了,又得做一张,跑了之后这个 Rick 从后面追过来了,然后再做一张。」每个动作单独做一个分镜,再用首尾帧串起来。
分镜学习方面,他推荐 B 站「老白的分镜课」,自己完全是在 B 站自学,从手画分镜到后来直接做。「昨天的时候那个老白他突然关注我,跟我说老师期待你做的下一个作品,能吓我一跳。」
工具组合:GPT 4O 生图,海螺 + 即梦做视频
刘士超自认不是技术人员:「我像使用 ComfyUI,我不知道在座的可能几百个人都会用……我用起来我觉得特别麻烦,所以我就干脆就不用了。」他的工具选择非常务实:
- 生图:主要用 GPT 4O 生图模型,Flash 模型也会用来做场景或参考。市面上的生图工具他基本都会用一圈,因为不确定哪个效果更好。
- 视频生成:主要用海螺和即梦。海螺表现能力强,但没有首尾帧;即梦有首尾帧,两者结合把分镜做成视频。谷歌的 Veo 3 因为图生视频控制效果差,没有主要使用。
- Veo 抽卡:Veo 多帧生成完全靠抽奖,无法控制效果。「你抽出来是什么样?可能这个能用,就很偶然。」他展示了一个用 Veo 做出来的镜头,镜头慢慢移动、停顿、再开车跑开,「你如果单独去做一个分镜,它其实反而是做不到这样的运动的……就你抽卡会突然抽出来一个这么一个东西,然后你觉得说哇?竟然能用,然后就拿过来了。」
提示词方面,他的经验是越简单越好。「你直接一句话就好了,你让这个人他干什么就行了。」要说明镜头是固定还是移动、是拉还是升还是推,然后说清楚角色在做什么。「它其实可以响应得很好。」
分镜制作:人物和场景分开处理
刘士超的分镜不是用提示词直接生成的,而是把人物和场景拆开做。他现场展示了工程文件:人物是单独抠出来的,场景是另一张图,在 PS 里合成。
「有的地方是因为它场景太复杂了……你如果两个人要运动,后面还有另外一个主体他在运动,那你这个就没有办法,你必须得把这个抠出来,必须要让他们把这个图层分开,前面的人单独做,然后后面的背景单独做,这样效果就会好很多。」
场景和人物的获取方式很多样:
- 实景取景:上海福州路的一个场景是真实取景后处理的。
- 画师手绘:李贝和西木拿着井盖的画面,是找画师手绘的。「这个用 AI 是真的做不出来,有的时候你没有办法,你必须手画。」
- 3D 模型:涉及正打、反打(人物对话的不同角度)时,他会用 3D 模型来保证场景一致性。
- AI 生成 + P 图:瑞克和莫蒂的角色主要在 GPT 4O 生成,「有一些图我是直接出来的」,但头发、秃头等细节需要单独 P 一下,或者用 Lora 调整。
他强调后期处理的重要性:「你直接用 AI 出来的东西,它很多没有办法直接用,你一定要去修改的。」P 图是制作中很重要的一部分。
创作节奏与成本:3 天写剧本,4 天做视频
刘士超以周更为目标时,节奏是「花 3 天去写剧本,然后另外的三四天就去把它做出来」。剧本方面,他会自己先捋清故事走向,再丢给 AI 起草对话,然后在此基础上修改。「和写论文差不多,你拿 AI 让他去帮你先起草一个东西,然后你在这基础上用自己的想法去进行这个修改。」
成本方面,他估算:「如果是普通的一些比较简单的镜头或者动作,十分钟的可能几百块钱,大几百块钱就是要的算力成本。」追逐戏这类需要大量尝试的特殊动作会花更多钱。相比传统制作成本降低了很多,但依然存在。
配音方面,他试过 Mini Max 等平台,认为差异不大,主要是克隆声音和语气。「有一些语气如果克隆不出来,我会自己配的,我会自己配完以后再去转音色。」
创作规划:先二创攒人气,再做独立 IP
被问到后续规划时,刘士超坦言:「我现在就是体量太尴尬了,我当时李贝的那一集我做了一个月,然后做完了之后,当时发完了就只有几千个观看。所以对我来说,我如果一个月的时间,然后只能做到这一点的观看人数,我是会吃不起饭的。」
他的策略是「先做二创,当我的体量做到一定程度的时候,我会真的开始做我自己的原创」。他之前做过秀湖系列,粉丝绑定很深,「2 万来粉丝,可能里面有 1 万 9 的粉丝全部都是秀湖的粉丝」,所以今年毅然决然停掉了这个系列,想拓宽创作领域。
他分享了一个「崩瓶盖」系列的创作思路:场景和角色分开制作后,场景可以反复复用。「你用不同的人把它放进去同一个故事的框架里面,你会呈现出一个完全不同的事情……完成了一种某种意义上的解构,把这个东西跳脱出原来的框架,然后重新去讲述这个东西,就会有另一层含义。」
他还提到自己一直想做成人动画:「我觉得在国内的这个市场是很空缺的。」他早期做过梦核系列,因为当时 AI 技术不成熟、画面本身就很超现实,「它讲不了故事,但是它反而能传递出一种很奇妙的情感」。等技术迭代到可以控制人物动作后,他才开始做叙事性内容。「我自己很喜欢梦核,然后我会特别想说做一个有故事性的梦核的片子。但是我觉得这会的技术还不太足以支撑起来,然后我还会再等一等。」
现场问答
瑞克和莫蒂的角色是怎么生成的?
主要在 GPT 4O 用模型生成,素材多、响应好。有些图可以直接出,但头发、秃头等细节需要 P 图,或者在 Lib 里用 Lora 调整。
可以演示一下即梦和海螺的抽卡过程吗?提示词怎么写?
提示词越简单越好,一句话就够。说清楚镜头是固定还是移动、是拉还是升还是推,然后说明角色在做什么。「你越简单越好……它其实可以响应得很好。」
配音用的什么?
Mini Max 有试过,其他平台也试过,但「这些平台是没有什么太大的差异的」,主要是克隆声音和语气。
制作成本大概多少?
看视频时长和复杂程度。十分钟的简单镜头,算力成本大几百块钱;追逐戏这类需要大量尝试的会更多。和平台有合作的情况下也需要充会员。
变现方式有哪些?
主要就是卖课和接单子。但他不太想做定制内容,「只要能把我房租交起来,我就不会再接了」。他还提到 B 站有人冒用他的视频卖课,「他说我的视频那个是他做的」,粉丝举报也没用。
AI 视频未来能达到什么程度?会一句话生成电影吗?
「一句话可以生成一个电影,但我觉得这个电影是没法看的。」他认为 AI 会受算力限制,「未来会到某一个瓶颈,它就很难去突破了」。他的期望是工具能把现有的流程优化到「一键做出一个比较好的效果」。
要点回顾
- 剧本和分镜占制作心血的 80%~90%,AI 在这部分帮不上太多忙。
- 分镜要切得足够碎,每个动作单独做一张,静态图也能讲故事。
- 人物和场景分开制作,复杂场景必须分层处理,后期用 PS 合成。
- 生图用 GPT 4O,视频生成用海螺(表现力强)+ 即梦(有首尾帧),Veo 靠抽奖碰运气。
- 提示词越简单越好,一句话说清镜头运动和角色动作。
- AI 生成的内容基本都需要人工 P 图修改,不能直接使用。
- 场景和人物可以复用,类似 3D 模型的逻辑。
- 十分钟视频的算力成本大约大几百元,特殊动作会更高。
- 创作策略:先做二创攒人气,再做独立 IP。
直播回放约 94 分钟
播放器来自飞书妙记 · 在新窗口打开