微缩世界里的北京:AI 视频创作全流程拆解与「我 AI 北京」大赛备赛指南
2025 年 8 月 18 日,AI 视频创作者娜乌斯嘉(娜娜酱)在 WaytoAGI 社区「晚八点共学」直播中,围绕「我 AI 北京——第二届北京城市形象 AI 创作征集」比赛,分享了一套从微缩景观视频制作到比赛投稿的完整方法论。她结合自己制作全国省份地标微缩视频的实战经验,逐一拆解了 Midjourney、即梦、豆包、可灵等主流 AI 工具的使用技巧,并给出了针对大赛的选题、避坑与时间管理建议。无论你是准备参赛的创作者,还是想系统了解 AI 视频制作流程的入门者,这份指南都能帮你少走弯路。
微缩景观视频的起点:提示词与垫图技巧
娜乌斯嘉的微缩景观视频灵感来自一个网络梗——将中国地名机翻成 RPG 地图风格的名字,再配上各省地标建筑的微缩模型。她强调,微缩模型的提示词核心就两个关键词:cinematic Micro photography(微缩摄影)和 isomax bird EYES view(鸟瞰视角),其余描述不必照搬。
「没有必要说跟我一模一样。」她建议,可以把这段核心关键词交给 Google 的 Gemini(免费版即可),让它按省份批量生成提示词,并指定「挑选每个省份的地标建筑」。这样生成的提示词质量很高,像悬空寺、南天门、少林寺等建筑,甚至不需要垫图就能直接生成。
不过,并非所有地标都能一次生成成功。娜乌斯嘉的经验是:像天坛、布达拉宫、福建土楼、东方明珠这类世界闻名的建筑,Midjourney 直接认识;但像广州塔(小蛮腰)、白塔这类建筑,直接生成的效果不稳定,就需要垫图。
垫图时,她推荐使用 Midjourney 官网版(国内版叫「悠船」),因为大部分操作可以可视化完成,不用记复杂的命令。垫图有三种模式,区别很大:
- Style reference:管画风,会继承垫图图片的风格,但不保留具体元素。
- Image transform:类似图生图,几乎保留原图所有元素,但会改变构图。
- Only reference:记录主体物的细节或特征,适合垫角色、产品、地标建筑。
垫图时有个关键细节:「尽量给它裁一下,不要垫整个这么大一张图,把周边的一些信息少带进去一点。」如果垫图后质感还不够好,她建议「循环垫图」——把生成结果再截下来垫回去,反复几次直到满意。
如果 Midjourney 垫图始终出不来想要的建筑效果,娜乌斯嘉有个巧妙的替代方案:先用豆包画一张微缩模型图,再拿这张图去 Midjourney 垫图。「豆包是认识中国地标建筑的,只是美学不如 Midjourney。」她提醒,豆包和即梦的模型同源,同一个提示词生成结果基本一致。
从生图到改图:工作流与效率工具
Midjourney 虽然审美最强,但每月 30 多美金(约 200 元人民币)的费用不低。娜乌斯嘉建议新手可以先在淘宝找人合租账号,6~10 人合租每人只要几十块钱,但要注意别买到中转或套壳的账号。
对于不想付费的用户,她推荐了开源模型方案。在 Runninghub 工作流平台上,可以找到大量免费或低成本的工作流:
- 千问 Image:相当于即梦 3.0,部署到本地不花钱,但网站生成速度稍慢。
- 万 2.2:动作迁移能力「已经吊打一些闭源工具」。
- Multitalk:开源领域对口型的 top 级别工具,上传图片加音频即可生成对口型视频,支持多人对话和音色克隆。
Runninghub 的使用门槛很低:「如果你是小白,就去 AI 应用里面,打开一个就像一个小 APP 一样,上传图片或输入文本就能生成。」高阶用户可以直接使用或搭建工作流,云端运行按分钟计费,几分钱一分钟,非常便宜。
改图方面,娜乌斯嘉重点推荐了 Context 模型,可以实现「万物改图」——把头发改成短发、金色,一句话就能完成,速度快且不影响画面其他部分。她现场演示了一个 Context 改图工作流:「你只需要知道往哪放图、往哪打字、这个工作流是干嘛用的就可以了。」她特别强调,工作流不必从头搭建,用现成的就行,就像玩电路玩具,「你作为一个使用的人,只需要点击一下运行」。
对于图片放大,她推荐在 Runninghub 搜索「万 2.2 分块」工作流,放大效果非常清晰。她还提醒,即梦的「细节修复」和「智能超清」两个功能要配合使用,先用细节修复重绘细节,再用智能超清提升清晰度。
视频生成:首尾帧与抽卡哲学
视频生成是娜乌斯嘉分享的重头戏,她最常用的工具是即梦,原因有三:生图模型好用、更新了首尾帧功能、费用相对较低。
首尾帧的原理是让首帧和尾帧的画面元素保持一致性,这样穿梭动画会更丝滑。她以「一家人在电视机前看电视,电视中是古罗马斗兽场」为例演示了完整流程:先分别生成客厅画面和斗兽场画面,用 PS 把斗兽场图片放进电视屏幕区域,保持两张图的画面元素一致,然后作为首帧和尾帧上传,提示词写「穿梭动画镜头穿梭到电视机里的古罗马斗兽场」。
「你让你画面里的某些元素保持一致性,他就能做出非常非常顺滑的首尾帧。」她强调,首尾帧的提示词要根据不同画面单独写,而且「最重要的就是抽卡,大力出奇迹」。她透露,自己那条全国省份微缩视频的完整版,抽卡抽了将近 1 万个积分。
即梦的 Agent 模式(灰度测试中)也是她强烈推荐的功能,尤其适合小说推文创作。它能自动完成故事大纲编写、画面风格创建、角色形象生成、分镜绘制,甚至直接跑成视频。「当这个功能出来之后,基本上小说推文应该就是 all in 了。」她展示了自己用该功能制作的暗黑版白雪公主故事,人物一致性和分镜连续性都相当出色。
平面作品与字体技巧
针对大赛的平面作品赛道,娜乌斯嘉分享了一批她收集的字体提示词,包括金属字、大米字、皮质字、鎏金字、绿色锈迹字、微观景字等。她提醒,在即梦中写字「一定要把所有的字放在文字效果增强的双引号里面,否则没有办法正确打出文字」。
她以「北京天坛 C4D 建模风格海报」为例,演示了平面作品的提示词写法:先说主体物(天坛 C4D 建模风格),再说整体色调(红色和金色),然后指定字体(毛笔字体)、构图(居中构图)和细节(精致的细节)。生成后如果出现乱码文字,可以用即梦的智能画布消除笔修掉,或者用 PS 处理。
她还介绍了即梦的参考图功能,上传参考图时可以选择不同的模式:角色特征(保持人物形象一致)、主体识别(相当于把主体抠出来换背景)、边缘轮廓(保持构图线条不变)、风格参考(模仿画风)、景深(适合建筑物)、人物姿势(模仿动作)。这些功能对保持角色一致性很有帮助。
现场问答
Q:PS 有什么平替工具吗? A:没有平替。「如果你玩 AI 的话,我是真的建议你一定要会一下 PS,不会 PS 你的坑会很多,你会很痛苦。」PS 主要用于裁剪、缩放、修掉多余元素等基础操作。
Q:做分镜用哪个工具比较好? A:即梦的 Agent 模式最好,但目前还在灰度测试。现阶段推荐用豆包做分镜,人物一致性非常好,适合小说推文类内容。
Q:国内有哪些图片下载网站? A:花瓣、包图等都可以。
Q:Midjourney 太贵了,怎么达成角色一致性? A:如果只是需要「人大概长这样」的还原度,在 Midjourney 的 Only reference 里垫图即可。如果需要更高的一致性,可以在 ComfyUI 里加载 Flux 底模,配合 Lora 模型做图生图重绘。
Q:即梦怎么去水印? A:目前只有即梦超级创作者(超创)能去水印。有观众分享技巧说,通过即梦 AI 的画布编辑后导出,选择两倍可以去除图片水印。
要点回顾
- 微缩模型提示词:核心是
cinematic Micro photography和isomax bird EYES view,其余描述可让 Gemini 按省份批量生成。 - 垫图三模式:Style reference 管画风,Image transform 是图生图,Only reference 记录主体物特征;垫图前先裁剪,减少无关信息。
- 循环垫图:生成结果不满意就截图再垫,反复迭代直到满意。
- 豆包辅助:Midjourney 垫图不出效果时,先用豆包画微缩模型图,再拿去 Midjourney 垫图。
- 改图用 Context:一句话改图,速度快、不影响其他元素;工作流用现成的即可,不必从头搭建。
- 首尾帧关键:首帧和尾帧画面元素保持一致,提示词根据画面单独写,穿梭动画会更丝滑。
- 抽卡哲学:视频生成「大力出奇迹」,重要作品要预留足够积分反复抽卡。
- 即梦写字:文字必须放在「文字效果增强」的双引号内,否则无法正确生成。
- 比赛建议:围绕北京主题创作(胡同、天坛、紫禁城、全聚德等),加中英文字幕利于国际化传播;回避国徽、伟人头像、国旗等敏感元素,地图必须完整;不要拖到最后一天提交,预留审核和修改时间;平面作品成本低,可以多抽卡多参赛。
直播回放约 133 分钟
播放器来自飞书妙记 · 在新窗口打开