跳到正文

从音乐到成片:金属文拆解 AI 短片《万相 2.2》的完整制作流程

讲师 金属文 · 20:00 直播

在 WaytoAGI 社区「晚八点共学」中,创作者金属文以自己使用万相 2.2(One 2.2)制作的短片为例,完整拆解了从创作动机、音乐制作、脚本分镜、生图、视频生成、配音音效到剪辑发布的 AI 视频全流程。这场分享适合正在尝试 AI 视频创作、希望提升短片质量与制作效率的创作者阅读——尤其是那些对角色一致性、提示词工程和音乐驱动叙事感兴趣的人。

创作契机:为什么用万相 2.2 做这部片子

金属文做这部片子有三个直接原因。首先是模型本身的吸引力。万相 2.2 发布后,他简单测试后认为「在开源里面来讲绝对是独一档、断档式的强」,虽然与闭源模型在某些方面还有差距,但使用门槛极低——在通义万象官网可以 0 积分免费使用,出视频速度也快,「基本上一个视频一分半钟就可以出来」。

第二个契机来自 B 站上一个关于游戏《烟云 16 声》的混剪视频。「他那个混剪的一个片子,然后就是比较燃,他的那个剪辑配上音乐」,这激发了金属文的创作冲动,想尝试做类似风格的片子。

第三个原因则与他的长期积累有关。金属文搭建了一个自己的提示词知识库,里面收集和撰写了大量提示词,包括文生图、图生视频、首尾帧、写分镜等各类模板。「正好以这次大赛为契机,以赛代练,去实验一下这些提示词。」

他的创作动机也与众不同——不是先写脚本,而是先做音乐。金属文大学时玩过乐队,深知乐队写歌通常先有一个创作动机,「要么是一个节奏型,要么是一个和弦进行,要么是一段旋律」。他做这部片子的动机就是音乐:先做出有感觉的音乐,再在音乐的结构和感觉之上写分镜,让视频更有节奏感和感染力。

音乐先行:用 SUNO 做分轨配乐

音乐制作选用的是 SUNO。金属文接触 SUNO 较早,比较熟悉。他写提示词时设计了多个段落,因为「音乐讲究一个起承转合,做短片其实也是一样,要有一个情绪的递进跟转折」。他的短片配乐大致分为开头荒凉悲伤、中间高潮、最后结束几个部分。

他分享了几个 SUNO 的使用要点:

  • 做纯音乐时,在生成界面选择 instrumental(纯乐器)模式,不用写歌词,只需描述风格和想用的乐器。
  • 如果脑海中有清晰的音乐段落,可以关掉 inspiration 功能,按段落详细描述——比如先写 intro 想要什么风格、什么乐器,再写主歌、副歌、过桥等。
  • 生成后可能需要抽卡,找到满意的音乐后可以用 Edit 功能修改不满意的部分。

最关键的一点是分轨导出。SUNO 现在可以直接获取歌曲的所有音轨(get stems 功能),这让剪辑灵活度大大提升。金属文举例:「前面他有很多轨的铺垫,有弦乐、有 Bass、有打击乐,我到这个地方不想要鼓跟 Bass 了,只有一层弦乐铺底」,这时分轨就派上了用场。

生图与一致性:角色设定图 + 风格固定 + 系统提示词

金属文选择图生视频而非文生视频,核心原因是一致性。「文生视频的话就没法控制这个一致性」,虽然现在很多视频模型(可灵、微度、万相 2.2)都有多参功能,但「如果你对你的镜头的机位运镜,然后包括一致性要求比较高的话,其实多参很难搞定」。

出图主要在 Midjourney 完成,一致性分为角色和风格两部分。

角色设定:金属文的习惯是先出四张角色设定图——正面、背面、全身、特写。「为什么要出正面跟背面?全身和特写?因为去参考的时候它这个效果会更好。如果你只有一个正面的,然后你要生一个背面的角度的话,模型可能出的结果不一定符合你的意愿。」他特别提醒,有些道具需要单独描述外观,比如霍去病拿的是汉朝骑兵使用的长槊,「提示里面他真的不一定知道槊是什么东西」。设定图不完整时还需要扩图。有了满意的设定图后,可以上传到 Midjourney,用 V7 的 only 功能做角色参考,比之前的 character 参考效果更好、泛化性更强。同时还要把角色的性别、国籍、年龄、服饰、武器等特征提取成提示词保存好。

风格固定:尝试二次元、写实、3D 皮克斯等不同风格时,把角色关键词和设定图垫进去出场景图,找到满意的画风后把风格提示词也保存下来。角色设定图、角色提示词、风格提示词三者组合,就决定了视频的一致性。

系统提示词:金属文借鉴了推特上一位博主的思路并加以改良,写了一段系统提示词,让大模型扮演「顶级的 AI 艺术总监和摄影师」,把用户的简单创意转化为专业级的摄影艺术创作指令题——包括用于构思的结构化源码和用于 AI 生成的高信息密度扁平化提示词。使用方法是单独创建一个窗口,把系统提示词粘贴进去,然后在这个窗口内做任务引导,比如「接下来要为短片设计一系列中国角色」,让大模型先出人物设定提示词,再出图。前期可以开启草稿模式提高速度。

特殊情况的处理:纯单帧图生视频遇到一致性冲突时,可以用首尾帧解决。金属文举例,一个小孩背书包的镜头,图生视频让他转身时,模型把书包背带理解成了马甲,「书包就变成马甲了」。解决办法是首帧用正面、尾帧用转过身去的画面,把所有需要注意的细节准备好。他还提到 Nano Banana 在制作第二天正式发布,「出现得太及时了,给我省了好多的时间」,另外千问 3 的图像编辑模型语义遵循能力很强,「特别是在生成中文的时候特别强」。

视频生成与素材筛选:先看官方文档,再省着抽卡

进入视频生成环节,金属文先梳理了当前主流模型的特点:中国的微度、可灵、渁梦海螺、万相 2.2 都效果很好,海外则是谷歌的 VEO 3 较强。「每个模型它都有自己擅长的地方,也有自己不擅长的。比如我发现海螺就非常擅长做特效和复杂的打斗镜头,万相 2.2 作为开源模型相对比较均衡。」

他建议使用每个模型前先看官方文档,了解提示词结构。万相 2.2 官方宣称的优势集中在美学表现、复杂动作和指令遵循三块。写提示词时需要描述清楚光源环境(光源类型、时间段、景别、构图、镜头)、动态(主体怎么运动、人物情绪、怎么运镜)和风格(写实、二次元还是皮克斯)。「细节越多,它其实可能离你设想中的结果就越好。」万相 2.2 对自然语言和 JSON 格式的提示词都能很好响应。

为了节省制作成本,金属文强调尽量用最少的抽卡次数达到想要的结果。「先按照你最初的想法先出一条,再根据结果看运镜、动作这些你不能妥协的地方是否体现出来了。如果表现出来了,那就是一发入魂。」他举例生成小孩转身翻白眼的复杂动作,如果提示词没表述准确,模型可能就直接走了,这时需要检查提示词该怎么改。

素材筛选有五个标准:画面不能有严重崩坏;保留大模型带来的惊喜效果(「它很多时候是不可控的,但这种不可控也有可能给你一些比较好的地方」);灵活使用首尾帧和局部边界;利用万相 2.2 的视频重绘功能(比如把蓝帽子改成红帽子);最后用 Topaz 或剪映的光流法做高帧高清放大补帧。

配音、音效与剪辑:让音乐节奏决定画面切换

配音用的是海螺(海外版叫 Mini Max),金属文特别推荐它的声音克隆功能——上传 20 兆以内的文件即可克隆音色,免费用户也能用,只是声音卡槽只有三个。常用参数方面,语速每次调整不超过 0.05,音高和音量按需调整。情绪参数他一般用 auto 自动识别,「人类的情绪肯定不光这几种,有的甚至没法用语言描述,用 auto 相对比较自然」。如果不想用海螺,也可以部署开源 TTS 模型到本地,「一般 4G、6G 显存就可以跑得动」。

音效方面,可以在剪映、站长素材等开源音效库找素材,也可以使用 VEO 3——它自带音效且效果不错,可灵和即梦的音效功能则「差得有点远,不是特别自然」。

剪辑是金属文自认「不太专业」的环节,但他分享了几点关键经验。因为先有音乐后有画面,他会把音乐的分轨导入剪辑软件,根据音乐的起承转合做分割标记。「比如中国传统音乐用中国大鼓一般是在重拍,也就是第二拍,那我们就在每个重拍的地方做分割标记,剪辑时就知道在鼓点出现时配合什么样的画面。」然后卡着音乐节奏对齐视频素材。

调色和曲线变速非常重要。「你用不同的视频工具生成的话,同一张图片生成的素材颜色可能会有差别,直接放在剪辑软件里非常影响观看体验。」剪映不擅长调色,一般用达芬奇。转场方面,他基本只用闪黑、闪白和叠化三种效果,另外也可以用首尾帧做转场——可灵 2.1 和海螺的首尾帧效果都很强。

发布与复盘:封面优先,关注跳出点

视频完成后,金属文分享了从油管博主 MrBeast 分享中提炼的三个自媒体要点:第一,先做封面再做内容,因为用户先看到封面和标题,这决定了点击量,「如果你的内容做得再好,但封面一坨、标题一坨,没人愿意点进来,流量也会特别差」;第二,发布后关注视频跳出点,找出跳出率最高的时间节点并优化;第三,前期立项时确保方向正确,过程中及时纠错,事后复盘防止重复犯错。

现场问答

知识库可以分享吗?

金属文的知识库因包含隐私和 NSFW 内容不便直接公开,他会修改或复制一个公开版本放出。提示词相关的内容(万相 2.2 关键词、文生图和图生视频的系统提示词、帮写提示词的提示词)会以 Markdown 格式结构化后发到群里和 WaytoAGI 文档中。

作品在哪里可以看到?

金属文全网账号同名「金属文」,外网账号叫「麦兜问」。李白视频的链接会发到群里。

如何用 AI 写提示词?有什么方法论?

金属文总结了一套「鲁棒性」方法论,保证提示词在大模型不断进化时不过时:用 RTF 结构(角色、任务、格式)结构化表达;信息尽量全面清晰,把大模型当成跨部门同事,「你没表达明白的地方,大模型就会自动联想,那就是幻觉」;正面表述大于负面表述;用 Markdown 等结构化语法;加入 few shot 正面示例;最后遵循奥卡姆剃刀原则,「用最少的词表达清楚意思,因为 TOKEN 消耗在生产环境里对成本影响特别大」。进阶技巧包括上下文工程(喂多模态内容帮助大模型理解意图)、思维树、思维链、提示词链等。

首尾帧视频之间色调有区别、衔接卡顿怎么办?

金属文给了三个方法:一是用 Sora 的 Remix 功能,上传两段素材后把第一段的后 5 秒和第二段的前 5 秒重新生成,解决卡断问题,但成本较高;二是在剪辑软件中导出静帧画面,把上一段视频的尾帧作为下一段的首帧,色调会更稳定;三是尽量在同一个视频生成工具里做首尾帧拼接,并在剪辑软件中调整运镜速度使衔接自然。

剧本怎么写才能有起承转合?

金属文坦言自己还没有成熟的方法论,「我是比较灵感型的选手,写好脚本其实不重要,最主要还是平时多看一些好的片子,积累感觉,看多了自然而然会有想法」。如果不想依赖灵感,可以关注猫叔的公众号,他最近研究脚本分镜比较多。

呼麦是怎么做的?

呼麦素材来自素材库,但要注意调性匹配——如果素材的调和背景音乐不一致,可以用免费的升降调工具处理。

要点回顾

  • 创作动机先行:先做音乐再写分镜,让视频节奏跟随音乐结构。
  • 音乐制作:SUNO 支持分轨导出,方便剪辑时灵活取舍乐器。
  • 一致性方案:四张角色设定图(正、背、全、特写)+ 角色提示词 + 风格提示词,组合使用。
  • 系统提示词:让大模型扮演 AI 艺术总监,把简单创意转化为专业摄影指令题。
  • 视频生成:先看官方文档了解提示词结构,用最少抽卡次数达到目标。
  • 素材筛选:画面无崩坏、保留惊喜、灵活用首尾帧和视频重绘。
  • 配音音效:海螺支持声音克隆,VEO 3 自带音效可用。
  • 剪辑发布:卡音乐鼓点切画面,调色用达芬奇,转场用闪黑闪白叠化;先做封面,关注跳出点。

最后,金属文分享了自己对 AI 视频终局的思考:「AI 视频的终局,其实就是内容的终局。形式一直在变,但那些能流传下来的东西都有一个共同点,就是足够好。」他鼓励大家找到自己真正热爱的方向,「热爱才能跨周期」。