从一句话到 AI 视频第一帧:用 DuMate 把生图变成可复用的内容流水线
AI 生图早已不是「输入一句描述、得到一张好看图片」那么简单。在 2026 年 6 月 29 日的 WaytoAGI 社区直播中,AI 图文与短视频双赛道创作者卡尔的 AI 沃茨,和百度搭子 DuMate 产品经理安蓓,一起拆解了一套完整的生图实战方法论:从公众号封面、小红书图文到 AI 视频首帧,核心不再是堆砌提示词,而是「说清用途」。本文适合所有想用 AI 生图服务自媒体内容、又苦于出图不稳定、反复返工的创作者。
生图理念的转变:从描述画面到说清用途
卡尔认为,生图的生态位已经发生了变化。过去用 Midjourney 或 Stable Diffusion 生图,图片更多是「分享到社交媒体」的单一产物;而现在,图片已经成为文字内容的基础资产——它可以做公众号封面、小红书配图,配上字体补充信息,甚至做成 PPT 或网页素材。
「我们其实已经不需要一个一个去背提示语了,更多的是要学会怎么用图片去表达我们想要表达的情绪。」卡尔强调,生图方式也早已不限于文生图,图生图、多图文生图、从 iPad 跨草稿生图都已成熟。
基于这个变化,他提出了一个核心观点:写提示语至少要提前说明五件事——主体、场景、风格、比例、用途。其中,比例和用途是过去最容易被忽略、如今却最重要的两项。
以公众号封面为例,卡尔特别提醒了一个「坑」:公众号封面必须是 21:9 的尺寸,但中间要留出 1:1 的空隙,因为这是别人转发文章时看到的缩略图区域。「如果你在这 1:1 里面表达不了整体的内容的话,别人看你的文章转发是看不到主要的点的。」
另一个关键技巧是:尽量用积极提示语,避免负面提示语。「你可以说要人物有五根手指,但是不要说不要人物有六根手指,不然他一定会生成六根手指的。」因为模型是概率模型,负面词可能因上下文被遗忘。但通过 agent 调用 skill 的方式,这个问题可以被规避——agent 会先确认参数、理解意图,再调用生图能力。
实战一:公众号封面与 AI 视频首帧
卡尔现场演示了如何用 DuMate 把一句话需求推展成可发布的素材。
公众号封面:他只告诉 DuMate「我要做这样一个公众号封面,主题是这个」,工具就根据他的上下文和喜好生成了封面。「我觉得还已经有百分之六七十像了,只不过太游戏了。」他觉得图片太像游戏海报,于是直接说「帮我把它改成新闻封面」——不是抽象地说「更严肃一点」,而是类比一个同场景类型。「一千个人有一千个哈姆雷特,每个人看到这个图可能表达的都不一样。更多的是你去类比一个同场景类,你觉得更符合你现在想要的一个封面的类型。」
AI 视频首帧:生成视频首帧时,卡尔建议把最重要的元素放在提示语的前面和后面,而不是中间。他演示了一个「男主站在巨大月球展厅内」的场景,并特别强调要在提示语中写明「适合后面 5 秒去做图生视频的动效」——如果不强调这一点,画面元素会塞得非常满。
更关键的是把用途细化。他最初只说「AI 视频」,生成的图偏真人漫剧风格;当他补充「这张图是用在漫剧上面的」之后,同一模型、同一上下文下,男主的画风、衣服褶皱、月球质感都变成了二次元漫剧风格。「你把这个用途从一级讲成二级之后,这张图片连清晰度看起来就高清了一点。」
卡尔还总结了视频首帧的三个检查信号:主体稳定性(给主体安排标志性特征,如黑色衣服,其他人物避开同款)、镜头空间(要拍月球和男主的交互关系,就得留出足够空间)、背景层次(前景后景分明,避免物理穿帮,如月光应洒在男主肩膀和地面倒影上)。
实战二:小红书封面与失败图片再利用
小红书图文封面通常需要加文字,但文字不宜多。「通常来说会有用到 4 到 5 个字来去说明一个主力字,其他的字一定要是你觉得大家都会很熟悉的品牌词。」卡尔举例,他会在封面放上「卡尔科」「Codex」这类有肌肉记忆的品牌词,比直接说「我在快速打通编程 agent」更有效。
他分享了一个视觉差技巧:灵感来自淘宝带货——把手机 logo 夸张到不属于它平时的大小,就成为展示产品的动作。制作过程分两轮:第一轮避免生成文字,把背景元素备好;第二轮再加文字。中间还可以接入自己做的素材,「大家直接拿个 PPT,把这个 logo 拉起来,把它组合去背景就可以了,不需要用那么复杂的东西。」
对于失败的图片,卡尔总结了三个高频错误点:
- 文字问题:文字少、乱码、劈叉,解决方法是后期添加,还能自己选字体。
- 构图太满:判断标准是「除掉黑色跟白色这两种最常见的背景色,重点色块超过三个之后,就会变成非常紊乱」。可以把图片拉满或打高斯模糊来观察。
- 风格跑偏:固定用途后再调整风格。
失败图片不必重跑。卡尔演示了一张只差一个字的失败图:「保留上图的主体跟结构,让他去调整背景的复杂度跟留白」,提示语甚至可以不加开头前缀框架,模型也能具体修改。
高阶玩法:风格融合、角色分镜与辅助线
卡尔介绍了四类常用的创意生图玩法:风格迁移、历史合影、角色分镜、视频首帧。
风格融合的关键是控制融合比例。「把我们想要融合的风格写到这样一张图片,这样迁移出来的风格是最稳定的。」他以梵高风格融合复古现实主义为例:主体是梵高风格,次风格是复古现实主义,写法是「把某一样风格的某一样物品做成另一个已有风格的整个夜景,来保留具体的笔触」。他特别提醒:风格化通常放在最后一步,等物体用途确定后再做,最后加文字说明。
角色分镜方面,他建议先 VO 出 4~5 个甚至 16 个不同角色,生成三视图保持脸型、服装、发型一致,再做成表情包或 AI 视频标示。「在一个故事版的基础上,我们完全可以把一个 30 秒或者 40 秒的视频的所有分镜都做出来。」
卡尔还分享了一套辅助线系统,用于多轮纠偏:
- 红色箭头:描述角色动作
- 蓝色箭头:描述镜头运动(远景、近景、中景)
- 黄色标注:描述光线变化
「用辅助线做 3 到 5 轮,你就已经可以完全改出一个你需要的东西了。」如果改不出来,「那我觉得应该是属于你还没有想好这张图片的用途」。他建议让模型自己画红圈划分图片模块,或把图片下载到 iPad 上画红线,「这比直接说哪哪哪不好会来得更直接」。
DuMate 的产品优势与新手入门路径
百度搭子产品经理安蓓总结了 DuMate 相比其他 agent 或对话式 AI 的三个特点:
- 精确度高:通过 Python 代码实现精准剪裁、模板匹配和像素级拼接,这是对话式 AI 在精度上难以达到的。
- 多模态可复现:调好的任务换图后可以执行得一样好,不用反复描述需求。
- 批量处理便捷:在用户授权下读取本地文件,批量自动命名、转换格式。
「这三个特点最终是落到一个字,就是省。」安蓓说,「人最终是需要释放自己做重复劳动、简单劳动的时间,然后去做更复杂的事情。」
对于新手入门,卡尔建议:去对应平台搜最近一周点赞最高的内容,截取适合自己用途的图片,用模板逆推提示语,生成 50~60 分的初版;再细化用途得到第二版、第三版;然后直接发出去看数据反馈(如打开率),告诉 agent 要避免什么。「你可能这样努力个一个月左右,你就能够造出来一个用途的足够数量的图片库了。」
现场问答
DuMate 对比其他生图工具的最大优势是什么?
安蓓:最大优势是精确性、可复现和批量处理。办公场景中,精确度能真正节省时间;创意场景中,也能更好地把握明确诉求。
新手零基础最快多久能跑通自媒体生图工作流?
卡尔:大约一个月左右。方法是搜平台点赞最高的素材,逆推提示语,明确用途后生成,再根据数据反馈和朋友意见迭代,逐步建立自己的图片库。
多轮对话纠偏怎么操作?
卡尔:用辅助线明确标注不满意的地方,通过图生图形式表达信息,一般 3~5 轮即可改出需要的图片。如果改不出来,可能是还没想好图片的用途。
AI 图片是否支持商用?
安蓓:用于大型活动等商用场景存在一定风险,用于自媒体传播和个人用途没有问题。
要点回顾
- 写提示语至少说明五件事:主体、场景、风格、比例、用途,其中比例和用途最关键。
- 公众号封面要 21:9 尺寸,中间留 1:1 缩略图空隙;小红书封面文字宜少,用 4~5 个字加熟悉品牌词。
- AI 视频首帧要把重要元素放提示语前后,写明「适合做图生视频动效」,用途越具体越好(如从「AI 视频」细化到「AI 漫剧」)。
- 用积极提示语而非负面提示语;排除项适合调整细节和风格趋向,主体和构图用确定词。
- 失败图片可保留主体结构,只调整背景复杂度和留白,无需重跑。
- 多轮纠偏用辅助线:红色标动作、蓝色标镜头、黄色标灯光,3~5 轮即可完成。
- 风格融合把要保留的风格写入图片,风格化放在最后一步。
- 新手入门:搜平台爆款 → 逆推提示语 → 明确用途 → 看数据反馈迭代 → 一个月建立图片库。
直播回放约 115 分钟
播放器来自飞书妙记 · 在新窗口打开