跳到正文

数字人如何拥有灵魂?一场从人设到成片的完整制作指南

讲师 JadeWu · 20:00 直播

2025 年 12 月 30 日,WaytoAGI 社区邀请到 AIGC 创作者、曾与贾樟柯合作导演共创计划的 JadeWu,围绕百度与乐华娱乐的「AI星企划」数字角色选秀大赛,分享了一套完整的数字人制作方法论。JadeWu 既是可灵、海螺、混元等多个平台的超级创作者,也有为华硕、AMD、王力宏等品牌和艺人制作数字人的商业项目经验。这场分享适合正在备战数字人比赛、想系统了解数字人制作流程,或对 AI 视频工具选型感到困惑的创作者。

数字人的四个维度:皮囊、灵魂、声音、表演

JadeWu 开篇就抛出一个观点:好看的角色不等于数字人,数字人的关键在于「有灵魂」。「它能给人一种活生生的感觉,它可能有它的故事,有他的背景,有他说话的风格,有他独特的语音,甚至有他的才艺。」而这一切,需要长期、持续的更新和运营来支撑。

他把数字人的构成拆解为四个维度:

  • 皮囊:外表要有高可辨识度,「一眼望过去,茫茫人海当中这个角色他能立刻被认出来」。这和现实中的明星逻辑一样,大众脸需要付出更多努力才能被记住。
  • 灵魂:这是需要持续运营的部分,要花大量时间构思角色的行为模式、背景故事。在 AI 大模型时代,灵魂塑造的第一步是「充分地去先打造一个人设」,有了稳定的人设,后续输出才能保持一致。
  • 声音:声音是让别人记住你的另一种途径,需要独特性和可辨识度。现在可以通过 AI 生成,但要注意避免「干巴巴的机械语音」,需要找能提供多模态、多情绪生成效果的语音工具。
  • 表演:普通表演用主流的视频生成大模型就能完成,但精准的舞蹈动作、复杂的运动,需要用到动作控制功能。

从创意到成片:数字人制作全流程

JadeWu 把数字人制作流程分为三大块:创意文本、出图、让角色动起来。

第一步是灵魂的文案创作。分镜、剧本、台词都可以借助大语言模型完成。JadeWu 个人偏爱 Google 的 Gemini,「它生成的内容在情绪和这个人味上会更好、更重一些」。

第二步是出图,也就是打造皮囊。工具选择很多:美学最好的 MJ、修改功能强大的 Nano、以及 Canva、可图、豆包、即梦等。JadeWu 分享了自己的工作流:先用 Lovart 调用 MJ 出人设图,进行角色长相的「海选」;选中满意的图后,改用 Nano 把图掰成正脸、去掉过度美妆或浮夸服装、替换穿搭;最后根据分镜批量生成氛围图,筛选出质感最好的作为基础,再向下拓展更多镜头。

第三步是让角色动起来。普通表演用图生视频工具即可;需要对白、台词时,可以使用可灵、即梦等工具的数字人功能;追求更精准的复杂动作,则需要动作控制。

最后是配音和剪辑。配音方面,JadeWu 重点推荐 Minimax 的 Audio,认为它是目前中文多模态、多情绪表现最好的工具之一;Elab 则在美音、英语外语方面有优势。后期剪辑用剪映即可完成。

可灵 vs 即梦:数字人工具实战对比

JadeWu 现场用同一张角色图、同一段音频,分别在可灵和即梦上生成内容做对比,结论很明确:

  • 可灵:使用数字人 2.0 功能,画质更好,原生 1K 清晰度能保留肤质细节。生成时间约 2 分钟。必须选择高品质模式,一次抽 4 条以保证效果稳定。
  • 即梦:生成速度快,但原生清晰度稍差,画面容易糊掉、抹掉皮肤细节。必须使用大师模式,只有大师模式才支持运镜和表演。

关于超分,JadeWu 提醒:即梦自带的智能超清本质是二次重绘,「它可能会改变你的人物的细节和轮廓」,对角色一致性要求高的项目要慎用。效果最好的超分工具是国外的 magnific,但价格较贵。

音画同出:新一代数字人技术

音画同出是 JadeWu 重点介绍的新功能——在图生视频时直接带语音,可以指定音色、台词、情绪和运镜。它的优势在于:

  • 支持非人形生物,识别能力强
  • 可以带表演、带运镜,比如背对镜头说话
  • 省掉了后期对口型的工作步骤
  • 使用指定音色时,吐字更清晰、效果更稳定;不用指定音色也能生成声音,但可能有吐字不清、每次声音不一致的瑕疵

JadeWu 特别强调,使用音画同出时要有时间概念:「你得知道你想要他说的这段对白,加上你想要的表演和运镜的氛围情绪,大概需要多长时间」,需要根据对白长度和表演复杂度选择对应的生成秒数。如果使用数字人音频驱动,则生成时长自动跟随音频,无需考虑这个问题。

动作控制:实现精准表演的关键

对于唱跳、动作片等复杂表演,JadeWu 展示了动作控制功能。在可灵 2.6 模型下,以视频为参考,可以使用官方动作库或自己上传的动作库。使用时有几个要点:

  • 多人动作无法识别
  • 人物太远或奇葩角度的动作无法识别
  • 建议使用能清晰看到整个人物、景别适中的参考视频
  • 生成时间较长,约六七分钟,需要抽卡优化结果

一个实用窍门:用不同景别的同角色图,配合同一个动作控制驱动,可以得到动作完全一致、可接续的多机位素材,让镜头语言更丰富。

现场问答

同一组动作不同镜头,具体流程是什么?多次抽卡能抽到不同镜头吗? 不是多次抽卡。需要准备不同景别的图(如全景、半身),用同一个动作控制去驱动。

跳舞视频的腰部特写是怎么做到的? 需要先有腰部特写的图。可灵新推出的 O1 功能可以基于已生成的视频切镜头,相当于「视频版的 Nano」,但需要抽卡。

MV 脚本一般怎么创作? 个人创作者需要自己写,用视频大模型或人工创作都可以。如果不想做创意部分,可以找有导演思维的人合作。

除了相交,还有什么切不同镜头角度画面的方法? 可灵 O1 可以基于已生成视频切镜头(需抽卡);即梦是在图生视频时通过提示词同步切出不同景别。前者是已有素材后修改,后者是生成时同步完成。

参考动作是正面镜头,可以实现侧面和其他面的特写吗? O1 可以解决,但有抽卡率。建议在分镜阶段就规划好,提前在图阶段出不同角度的视图,比后期修改更稳定。

可灵生成数字人横屏和竖屏有区别吗? 没区别,只是景别问题。

声音画面同步怎么做? 目前一般分段进行。做大长镜头可以用首尾帧方法。

怎么捏出独特的声音? 可以在 Minimax 中采样自己的声音来克隆。

AI 工作流的数字人和元宇宙引擎的数字人有什么区别? 现阶段,元宇宙引擎的数字人带交互,通过游戏引擎 3D 驱动;AI 工作流的数字人无法实时交互,只能做成品。但未来随着世界模型发展,两者区别会消失。

AI 音乐怎么保持声线一致性? 可以了解 Sono,它能基于已生成的唱腔或声音固定音色,进一步生成。

大幅度运镜用什么模型和提示词? 可灵和海螺的 2.3 模型最适合大幅度运镜,也可以用首尾帧控制。提示词如「第一视角高速飞跃、高速推进」等,要简洁,避免权重分散。

要点回顾

  • 数字人 = 皮囊 + 灵魂 + 声音 + 表演,核心是持续运营,不是单纯炫技
  • 制作流程:大语言模型写创意文本 → MJ/Nano 等工具出图 → 可灵/即梦数字人功能或动作控制让角色动起来 → Minimax Audio 配音 → 剪映剪辑
  • 可灵画质好但生成慢,即梦速度快但画质稍差;两者都要用高品质/大师模式,且需要抽卡
  • 音画同出可以省掉对口型步骤,指定音色效果更稳定
  • 动作控制适合复杂表演,注意参考视频要单人、景别适中
  • 在 AI 时代,技术迭代太快,创意和审美才是最值钱的

直播回放113 分钟

播放器来自飞书妙记 · 在新窗口打开