跳到正文

AI 短剧的音频设计:从配音、BGM 到音效的实战工作流

讲师 沐己 · 20:00 直播

在 AI 短剧制作中,音频往往被当作后期环节,但资深导演、剪辑师沐己(老王)在 WayToAGI 社区「AI短剧训练营」第 6 课中提出了一个反直觉的观点:音频工作应该前置到生图阶段之前。这场分享围绕 AI 短剧的音频设计展开,系统拆解了漫剧与真人剧的音频差异、配音工具的选择与使用、BGM 的生成逻辑以及音效的获取途径。无论你是刚入门的 AI 视频创作者,还是希望提升短剧成片质量的剪辑师,这篇文章都能帮你建立一套可落地的音频工作流。

漫剧与真人剧:音频角色的根本差异

沐己在课程开头播放了同一部剧(《一人之下》)的真人版和漫剧版两段音频,让学员分辨差异。他借此强调,AI 短剧创作者必须清晰认知两种体裁在音频上的根本区别,否则音频容易出问题。

音频分为音乐、音效、配音三个板块,在漫剧和真人剧中有明显区别:

音乐:漫剧强调情绪反差、剧情爆点,并弥补画面简化的缺陷——漫剧分镜不像真人剧有那么多的位置关系和人物表达,需要观众脑补,音乐因此承担了带动叙事节奏的作用。风格上更夸张、更多样、起伏大,密度上几乎从头到尾都有 BGM 烘托。真人剧的音乐则只为烘托场景氛围、贴合人物状态、弱化表演痕迹,风格克制且写实,观众往往很难感受到 BGM 的存在,人声和环境声占据主导地位,音乐只在关键剧情插入。

音效:漫剧音效非常丰富且夸张,转场、人物动作都需要音效补充,因为漫剧没有现场录音,全靠后期制作。真人剧音效写实、细节化、真实化,一般现场就完成了录制。

配音:漫剧配音演绎非常夸张,能体现人物个性和标签;真人剧配音自然生活化,贴近真实对话。

沐己总结道:“漫剧的音频是主动的引导叙事,而真人剧的音频是被动的烘托氛围。”在漫剧里,音频是核心因素,是“ADC”,整个剧情的爽感和沉浸感主要靠音频输出;在真人剧里,音频则处于辅助角色。

音频前置:用声音定视觉的剪辑思路

沐己提出了一个关键的工作流观念:音频工作一定要放在前期,而不是等拿到视频素材后再处理。

他解释,传统流程是剧本拆分镜、生图生视频、剪辑,最后才处理音频。但如果没有丰富的剪辑经验,拿到素材再做音频,很容易陷入视觉陷阱——音频跟着视觉走,导致片子节奏忽快忽慢。人对音频的节奏感比对视觉的节奏感更容易把握,因此应该反过来,用音频来定视觉。

沐己分享了自己的实际操作:在他的项目里,生图师还在生图时,他就已经开始制作音频了。在拿到视频素材之前,配音和背景音乐已经大致制作完毕,音效则等视频出来后再加。“基本上我会闭着眼睛去听整个音乐的节奏和配音”,他说。

具体做法是:拿到剧本后,对每一场戏进行节奏和音频风格的判断——这场戏是欢快、刺激、惊悚还是紧张的氛围?大概有多少镜头、对应多长时长?然后先把配音配出来,放进剪辑软件留好气口,再配上背景音乐。这种“先定音频、根据音频来定视觉”的工作流,也是影视飓风、食频道等知名视频博主的通用做法。

配音工具:从剪映克隆到 TTS 与海螺

沐己介绍了三种主流的 AI 配音方式,并逐一说明了优缺点。

剪映预设与音色克隆:剪映的预设配音大部分不可用,沐己表示自己基本把所有音色都听过一遍,只有五六个可以配配角或旁白。更好的选择是音色克隆。他以《一人之下》为例,演示了如何截取角色不同情绪的对话片段进行克隆。克隆的缺点是无法调整声音情绪,所以“最少一个角色有那么 3~4 个不同的情绪的声音去做克隆”,这样创作时不同情绪的配音能提升整部片子的成色。

沐己提醒,克隆音色不涉及版权问题,但直接使用原声则不行。他建议:“如果你是要真正做短剧的话,我建议还是用真人配音”,目前 S 级漫剧的普遍做法是前 10 集用真人配音,后面 20~60 集用真人音色克隆来降低成本。

TTS 工具(liblibu 的 ComfyUI 工作流):沐己推荐了 liblibu 平台上的 ComfyUI 音色克隆工作流,学员可在课件中下载工作流文件直接导入。操作步骤为:上传音色文件 → 试听 → 将想要输出的文本复制到指定位置 → 调整情绪参数(有 happy、angry、sad、fear、hate、low、surprise、natural 八个维度,数值 0~1,0 代表无倾向,数值越高情绪越强)→ 点击开始生图。该工具免费,且音频对算力需求不高,但情绪值调试比较麻烦,需要耐心。沐己建议调好后把情绪参数复制保存到文档里备用,免得下次忘记。

海螺(MiniMax):海螺是沐己常用的工具,虽然付费但方便,除了配音还能进行音乐创作。国内版不能克隆音色,需要自己设计音色;国外版可以克隆。新注册用户有 1 万积分,约可输出 11,000 字文本的声音,对应约 5 分钟时长,适合前期上手。海螺的局限是只能生成歌曲,不能生成纯音乐,用剪映去人声可以得到纯音乐,但效果不如真正的纯音乐。

BGM 与音效:一场戏一段音乐,AI 音效够用

BGM 的选择与生成:沐己强调,BGM 设计来源于对剧情的理解,而不是随便生成。他以自己的项目为例:第一场戏男主在鸿威宝殿俯视弟子,需要磅礴大气的音乐;第二场戏男主发现师尊签了封神榜、截教将覆灭,整个人是懵的,需要情绪急迫的音乐。

对于不知道如何配乐的初学者,沐己给出了一个简单方法:把剧情发给豆包,请它分析剧情内容并设计合适的背景音乐提示词,然后把提示词发给苏诺 V5 的灵感模式进行创作。他建议“一场戏用一段 BGM”,如果一场戏中有情节转折或突发事件,BGM 也要相应变化。衔接方式可以用剪映的转场,也可以用关键音效。

音效的获取:沐己直言,目前单独的音效设计工具还不完善,可灵的音效设计功能虽然齐全,但生成效果“特别的拉胯”。现在音效主要来自自己的音效库或 AI 音效,AI 音效能满足 70%~80% 的需求,音乐库里的纯音乐能满足 60%~70% 的需求。他推荐使用剪映音效库或网上音效库,但不建议购买网上动辄几百 G 的音效库——“你真的要从网上买的音效库里面找到你想要的音效,实在是太难了”。

剪映、豆包、即梦等工具都有根据视频配音效的功能,沐己实测大部分情况下可用。他提醒,漫剧本质上就是“电子榨菜”,“它不追求非常严谨的内容,也不追求这种高精的制作,更吃的是剧本、爽点的呈现和音乐的渲染,爽就完了”。

现场问答

不同平台用同一张图片生成的视频,帧率、分辨率、画幅比不一样,能剪到一块吗?

大鹏:基本上都有 1080P,如果你有会员的话,每个平台都能选到 1080P。都选 1080P 放在一起基本没问题,但要注意画幅比可能有细微差异,有的宽少 1%,有的高少 2%,需要调一下。切镜过场时,如果两个镜头很近,转那一下要加个转场特效,不然容易出问题。最麻烦的是色差,不同平台出的镜头放在一起颜色会跳。最好用同一平台出片,如果混用,有能力就调色(用达芬奇或剪映都行),其次是加滤镜统一颜色,再不行就加转场特效(叠化、运镜类转场比较常用,别太夸张)。但调色太难,大家尽量别调,用转场和滤镜解决就好。

要点回顾

  • 漫剧音频主动引导叙事,是核心因素;真人剧音频被动烘托氛围,处于辅助角色。两者在音乐、音效、配音三个板块的风格和密度上都有根本差异。
  • 音频工作应前置:在生图阶段就开始制作配音和 BGM,拿到视频素材前完成音频主体,用音频节奏来定视觉节奏,避免陷入视觉陷阱。
  • 配音工具三选一:剪映音色克隆最方便,但需为每个角色准备 3~4 个不同情绪的克隆片段;liblibu 的 ComfyUI TTS 工作流免费且可调情绪参数(0~1),但调试需要耐心;海螺付费但方便,新用户 1 万积分约可输出 5 分钟音频,国内版不能克隆音色。
  • BGM 生成:把剧情发给豆包分析并设计提示词,再用苏诺 V5 灵感模式创作。一场戏用一段 BGM,情节转折时更换,用剪映转场或关键音效衔接。
  • 音效获取:AI 音效能满足 70%~80% 的需求,剪映、豆包、即梦的根据视频配音效功能大部分可用。不建议购买几百 G 的音效库,查找太麻烦。
  • 行业参考:漫剧行业标准约为一人一天一集(2 分钟),一卡通常 10 集;接单报价 500 元/分钟若能保证质量,就能在市场上具备竞争力。

直播回放173 分钟

播放器来自飞书妙记 · 在新窗口打开