跳到正文

从 5 秒到完整短片:通义万相 2.2 线上实操与 ComfyUI 本地部署全指南

讲师 小歪猪哥 · 20:00 直播

2025 年 8 月 5 日晚,WaytoAGI 社区「晚八点共学」直播聚焦 AI 视频创作,邀请视频版版主小歪与开源开发者朝戈(长毛猪)分别带来通义万相 2.2 线上版的功能全景实操,以及 ComfyUI 本地部署与 Wan2.2 模型首尾帧工作流的硬核教学。无论你是刚接触 AI 视频的新手,还是想将开源模型部署到本地的进阶玩家,这篇文章都值得一读。

通义万相 2.2 线上版:从提示词到成片的全流程实操

小歪的开场演示来自通义万相为本次大赛制作的宣传片——除开头和结尾的 3D 部分外,中间所有画面均由通义万相 2.2 模型生成。她强调,本次比赛要求所有内容在通义万相平台完成,投稿需发布至抖音并带上「万象生动」「万象妙思」「WIC 美好奇妙世界」三个 tag,同时填写作品登记问卷,三者缺一不可。

对于从未使用过 AI 视频的创作者,小歪建议从「灵感广场」入手。这里汇集了大量优秀作品,点击任意作品可查看其提示词与生成方式(文生视频或图生视频),并可直接「做同款」一键套用。更系统的方法是使用官方提供的提示词模板,其基础公式为「主体 + 场景 + 运动」,进阶则需对三者分别细化:主体可描述服饰、身份等特征,场景可说明时间、氛围,运动则可描述连贯动作序列。小歪特别提到,官方模板对模型适配性最好,她将模板中的美学控制、动态控制、风格表现等类别全部实测了一遍,效果稳定。

模型能力全景:光线、景别、运镜与风格化

小歪将通义万相 2.2 的能力按维度逐一演示,所有示例均为文生视频,且大多「一条过」。

光线与色调:模型支持日光、人工光、月光、火光、霓虹光、阴天光、混合光、晴天光、柔光、顶光、侧光、背光、底光、边缘光、剪影、低对比度、高对比度、白天、夜晚、黄昏、黎明等多种光线效果。小歪建议根据片子类型选择,例如悬疑片适合高对比度,生活记录类适合自然光。

景别与构图:从特写、近景、中景、中近景、中全景、全景到广角,模型均能精准呈现。小歪特别展示了近景镜头对人物情绪变化的细腻刻画——从微笑到眼眶湿润再到抬头望向窗外,情绪转变自然流畅。构图方面,中心构图、平衡构图、左右侧重构图、对称构图均有良好表现,其中对称构图对纵深感的表现尤为出色。

镜头与运镜:模型支持正反打、过肩镜头、高角度、低角度、倾斜角度、航拍、俯视等机位,以及推近、拉远、左移、右移、上摇、跟随、环绕等运镜方式。小歪指出,倾斜角度配合冷色调可营造惊悚感,低角度适合塑造主角伟岸形象,高角度则能表现人物的渺小无助。

动态与情绪:模型对运动控制的表现令人惊喜——踢足球能踢中并射飞,篮球能真实入筐且网子波动自然,甚至非遗顶碗舞、侧手翻等复杂动作也能完成。人物情绪方面,愤怒、恐惧、高兴、悲伤、惊讶等均有细腻呈现,过渡丝滑不突兀。

风格化与文字:模型支持移轴摄影、延时拍摄、毛毡风、像素风、粘土风等风格化效果。更值得一提的是,模型能在视频中生成文字——小歪演示了「miss y」字样出现在广告牌灯牌上,以及复合镜头中「miss white」字样定格在机器上的效果,科幻感十足。

进阶功能:局部编辑、视频重绘与项目集

小歪重点演示了三个实用功能,解决创作中的常见痛点。

局部编辑:可对已生成视频中的主体或背景进行替换。操作时先上传视频,系统会自动进行智能选区,将人物拆分为头、身体、服装等部分,用户可按需框选。替换主体时上传参考图并描述动作,模型会保留原视频的姿态与动态;替换背景时则需框选背景区域而非人物。小歪提醒,提示词描述越具体,模型扩散思维越少,例如明确「不戴墨镜」可避免意外添加。

视频重绘:在保持原视频构图、动态和主体不变的前提下,改变整体风格。小歪演示了将写实汽车重绘为冰天雪地中的蒸汽式汽车,以及将彩色视频转为高对比度黑白风格。该功能可无限次使用,用于统一多段视频的风格或调整画面亮度等细节。

项目集:这是解决「5 秒视频如何延长」的关键功能。在项目集中,用户可将多个单镜头视频按时间线串联,并通过「使用该帧」功能提取任意视频的某一帧作为下一段视频的首帧,实现故事延续。小歪以侦探悬疑片为例,演示了将彩色电话亭镜头重绘为黑白风格以匹配室内镜头,再提取最后一帧生成行人走来的新镜头,完整延续了故事线。她强调,项目集适合调整视频内容和衔接,但复杂转场仍需在剪辑软件中完成。

ComfyUI 本地部署:从安装到跑通 Wan2.2 首尾帧工作流

朝戈(长毛猪)的分享面向想将开源模型部署到本地的用户。他首先介绍了 ComfyUI 的安装:Windows 和 Mac 用户可直接从官网下载打包安装包,Linux 用户则需通过源码安装。安装时建议将 PIP 镜像源改为清华或阿里镜像以加速下载。首次运行会打开空白画布,导入工作流文件后若提示缺失节点,可通过「包管理器」一键安装所有缺失节点并重启。

针对 Wan2.2 模型,朝戈指出开源版本分为 i2v(图生视频)和 t2v(文生视频)两种,需区分放置。除扩散模型外,还需下载三个配套模型:OpenAI 的 CLIP(用于文本与图像采样)、文本编码器以及万相自研的 VAE 模型,均需放入 ComfyUI 对应的模型文件夹中。

在参数配置上,朝戈建议根据显卡显存调整「block swap」值——4090 等 24G 显存显卡可用默认配置,Mac 笔记本可调至 40 以上以降低显存占用。分辨率与总帧数也可调整,但增大分辨率会显著增加显存占用和推理时间。他特别提到,本地部署可突破线上版单次 5 秒的限制,但长视频对硬件稳定性和显存要求更高,建议在推荐范围内调整。

对于本地部署无法使用线上版音效功能的问题,朝戈解释,音效属于企业产品功能,其实现方式属于商业秘密,未随模型开源属正常现象。他同时表示,开源社区迭代迅速,动作姿态、物体参考等拓展功能预计很快会有大佬提交实现。

现场问答

Q:生成视频时自带的音乐风格不一致,如何衔接才不突兀? A:如果对 AI 生成的音乐不满意,可在后期剪辑时屏蔽原声,重新配一条完整的音乐。

Q:已生成的视频太黑,想调亮一些怎么办? A:使用视频重绘功能,直接描述「画面变亮」即可,可无限次重绘调整。

Q:能否将视频中的英文字母换成动态广告效果? A:需使用图生视频模式,在首帧图片中预先放置广告画面,再描述动态效果。

Q:项目集能否自动生成分镜间的过渡衔接? A:项目集的转场默认为直接切换,适合调整视频内容和延续故事,复杂转场建议在剪辑软件中完成。

Q:本地部署对电脑配置有什么要求? A:建议查看显卡架构是否被 ComfyUI 兼容,Windows 用户可参考秋叶等社区打包的启动器,Mac 用户需注意 MPS 推理架构的显存管理。

Q:本地部署能否使用线上版的音效功能? A:音效属于企业产品功能,未随模型开源,本地部署暂不支持。

要点回顾

  • 通义万相 2.2 支持文生视频、图生视频、首尾帧生视频,以及局部编辑、视频重绘、图片参考、项目集等进阶功能。
  • 官方提示词模板(主体 + 场景 + 运动)对模型适配性最好,进阶可细化美学控制、动态控制、风格表现等维度。
  • 模型支持丰富的光线、景别、构图、运镜、动态、情绪和风格化效果,建议根据片子类型选择对应提示词。
  • 局部编辑可替换主体或背景,视频重绘可统一风格或调整细节,项目集通过「使用该帧」功能实现 5 秒视频的无限延续。
  • ComfyUI 本地部署需区分 i2v 和 t2v 模型,并配套下载 CLIP、文本编码器和 VAE 模型。
  • 本地部署可通过调整 block swap 值、分辨率等参数适配不同显存配置,但音效等商业功能未随模型开源。

直播回放144 分钟

播放器来自飞书妙记 · 在新窗口打开