千问 Image 技术拆解与海报创作实战:从模型原理到提示词秘籍
8 月 28 日晚,WaytoAGI 社区「晚八点共学」邀请阿里巴巴通义千问视觉生成负责人吴晨飞博士,围绕开源文生图模型 Qwen-Image 展开了一场技术分享与创作灵感直播。吴博士详解了模型在中文文字渲染上的核心突破、差异化优势与训练经验,三位参赛选手分享了海报创作思路,现场还解答了关于移动端适配、地图抠像、文字位置描述等实际问题。本文适合 AI 绘画创作者、设计师以及对文生图模型技术原理感兴趣的读者。
核心突破:原生中文文字渲染
吴晨飞博士指出,Qwen-Image 最核心的技术突破是「原生的文字渲染能力」。此前文生图模型在生成中文时普遍困难,小字不清楚、字多容易花掉,且中文生成比英文更困难。团队从数据合成和模型设计两个方向集中攻关。
在数据方面,团队设计了一整套复杂的数据收集、过滤、合成流程,最终获得一套高质量的带文字渲染数据,包含真实海报数据、真实世界中拍摄的带文字数据以及合成数据。
在模型设计方面,团队采用 OCR 能力很强的 Qwen2.5-VL 来编码文本,并使用 20B 参数的 MMDiT 模型对文本和图像进行整体注意力处理。与 Flux 等模型使用的单流加双流结构不同,Qwen-Image 完全采用双流结构,以最大程度提升文本和图像的注意力,增强细粒度文本控制力。
差异化优势:中文能力与开源生态
吴晨飞博士总结了 Qwen-Image 的两大差异化优势。
第一是中文文字生成能力。 在团队设计的测评数据集中,Qwen-Image 的一级汉字准确率高达 97%,而 GPT-4o 仅为 68%。「97% 和 68%,我觉得这就是一个能用和不能用的区别。」二级汉字准确率为 41%,GPT-4o 只有 16%。团队对文字生成的理解是「易字稳、难字能写」——常用字稳定生成,生僻字多次尝试也大概率能生成。如果遇到实在写不出的生僻字,还可以通过图像编辑能力专门编辑字的偏旁部首。
第二是开源。 Qwen-Image 是目前性能最好的开源模型,在 LM Arena 竞技场的文生图和图像编辑榜单上均排名靠前。模型采用 Apache 2.0 license,允许商用,训练和使用过程中无水印。吴博士特别承诺:「我们 Qwen-Image 在整个训练的过程之中,以及我们在最后的阶段是没有去增加任何的水印的。」
在风格化能力上,吴博士引用 Nano Banana 官方博客的对比数据:「至少在一项 stylization(风格化)上面一定是比 Nano Banana 好的。这句话不是我说的,是 Nano Banana 自己说的。」此外,Qwen-Image Edit 还可以去除 Nano Banana 生成图像上的水印。
应用场景:海报、IP 创作与更多可能
吴晨飞博士介绍,Qwen-Image 应用最广泛的场景是海报创作。「事实上我已经发现有不少 up 主都是在用我们的模型做封面了,因为我们的模型可以天然地把文字和图像组合在一起,你实际上都不太需要排版了。」
IP 创作也是模型的强项。千问的吉祥物卡比巴拉的相关图像很多是用 Qwen-Image Edit 创造的,内部运营同事表示工作效率提升非常多。
吴博士还分享了一系列社区衍生产品和有趣案例:
- ControlNet:InstantX 团队制作,可让图像风格修改更稳定。
- 麦桔美人 Lora:提升人像生成效果。
- AW Portrait Lora:人像效果真实。
- 手办生成:通过合理设计提示词,描述将照片转化为角色形象、建模过程等内容,可轻松做出手办效果。
- 多视图生成:使用提示词「generate the front view, left view, right view, back view」即可实现,在未来 3D 建模中有很大应用潜力。
- 艺术字体编辑:可将输入字体变成 3D 效果并悬浮在街道上,空间漂浮感和背景模糊都处理得很好。
- 万物迁移:可将衣服、鞋迁移到模特身上,或将广告产品图贴到模特手上,在广告设计领域有实际应用价值。
- 线稿上色:传统渲染速度慢,若模型渲染效率和效果进一步提高,将对设计师有很大帮助。
- 结合世界知识的图像编辑:输入「顺着红色箭头的方向会看到什么」,模型能直接在图片上生成箭头并指向相应物体。
训练经验:坚持解决文字问题
吴晨飞博士坦言,团队在训练过程中踩过很大的坑。早期尝试直接喂文字数据,出现图片中文字模糊、多余等问题,中文效果尤其差,甚至一度陷入「要不要把带文字的数据过滤掉」的怀疑。
但团队最终坚持解决文字问题。「你一旦说此刻退让了,我不去解决这个文字问题了,我把那些文字数据都过滤掉了,那你的模型实际上你就一直学不会这个文字。」文字效果会逐渐提升,存在一个泛化的临界点,达到该点后模型就能较好地生成文字。
在模型选型上,使用 Qwen2.5-VL 带来了很大收益,其 OCR 能力强,为解决文字问题提供了重要支撑。
提示词使用技巧
吴晨飞博士认为,提示词非常关键,「本质上就是去区隔数据,集中你想要的一些好的数据」。不同模型因训练数据不同,所需提示词也有差异。他分享了具体技巧:
- 保持训练推理一致:生成文字时,训练数据中带文字的数据大多用引号引起来,所以推理时写提示词也应用引号括起文字,避免训练和推理出现 gap。
- 避免否决词:提示词中避免出现「不要生成什么什么」等否决表述,对模型并不友好。
- 明确文字位置:复杂逻辑用相对位置法更稳定,通过定义文字间的逻辑上下左右关系,让模型整体排布;简单明确位置可用绝对位置法,如左上角、右上角等。
- 明确风格:写提示词时最好明确风格,如纪实摄影风格,模型更有概率区隔对应训练数据。
- 详细清晰描述:避免模糊表述,如明确邀请函上的名字和日期,详细描述画面内容、主体特征等。「不怕你写得长一点,就怕你写得非常短。」
团队在 GitHub 官方网站上提供了 rewrite 函数,可将用户 prompt 改写成生成效果更稳定、更好的 prompt,其中包含 9 条任务要求,涵盖保留主体细节、描述主体特征、用引号规范文字、避免模棱两可、明确风格等要点。
选手创作分享
俊:老广州文化符号
俊是投稿量最多的选手,提交了 16 个参赛作品。他选择广州为主题,避开常见的大城市现代形象,转而挖掘老广州文化符号,如广式月饼、广东凉茶等。在广州塔海报中,他运用冷光与暖光的搭配,配合文案「城市的光,一半照着未来,一半暖着过往」,体现广州既现代化又有传统文化的特色。
他的提示词全部用 AI 模仿民国作家笔法写成,创意实现效率很高。「我每一个创意都没有肉多少次,我直接在摩达里面,四张里面可能真的就有一张是特别符合我要求的。」
笨笨:谐音梗创作
笨笨最初想将 AI 与古代结合创作西安挖掘图,但因其他城市场景构思困难,改为谐音梗方式。选择谐音梗是为了更好体验通义模型的文字效果,也符合当下年轻人喜好。
他写提示词有固定格式:先写文字内容(主标题、副标题、装饰文字),再描述画面(风格、色彩、细节),最后明确文字位置。他还将 Qwen2.5-235B 与 Qwen-Image 结合使用,先由前者输出谐音内容,再用后者生成文案和图片。
迷人的小赫敏:结构化提示词
她的三张海报分别学习了茶颜悦色手卡设计、生成摄影作品和报纸样式海报设计。通过人机协作拆解茶颜悦色手卡元素,用结构化提示词复现手卡——定义了三十几个字段,测试发现结构化提示词效果优于非结构化。
报纸海报使用固定排版框架加可替换变量关键词,输入「人民广场大鹅」等关键词,千问就能自动生成搞笑文案和完整海报,如「人民广场惊现巨额群,市民争抢下锅,市民王阿婆惊呼,真是要煮茶吃饭,这鹅比我家狗还肥」。
现场问答
Qwen-Image 后续是否推出更小 size 适配移动端? 团队有在探索,但面临挑战:size 小到什么程度,文字能力还能否保持可用效果。模型目标是做能用、好用、有中国文化、有中文渲染能力的模型。
如何用气象预报图做新媒体海报? 这是复杂任务,需借助额外工具(如 CV 分割模型)提取地图有效区域,用 Qwen-Image 为海报打底并设计文字,再进行风格融合。可尝试将抠出的地图贴到海报对应位置,或进行多图输入,使其自然融入新背景。
如何描述文字位置? 复杂逻辑推荐相对位置法,通过定义文字间的逻辑上下左右关系,让模型整体排布;简单明确位置可用绝对位置法,如左上角、右上角等。
中文提示词和英文提示词哪个效果更好? 生成中文文字、中国场景或元素时,中文提示词更好;生成英文文字渲染时,英文提示词更佳。中英文混合时,根据比例选择。
要点回顾
- Qwen-Image 核心突破是原生中文文字渲染能力,一级汉字准确率 97%,追求「易字稳、难字能写」。
- 模型采用 Apache 2.0 license,允许商用,训练和使用无水印。
- 海报创作、IP 创作是模型最强应用场景,风格化能力在 Nano Banana 官方对比中胜出。
- 提示词技巧:文字用引号括起、避免否决词、复杂位置用相对位置法、明确风格、详细清晰描述。
- 社区衍生产品丰富:ControlNet、麦桔美人 Lora、AW Portrait、万物迁移等。
- 比赛主题「地方风物」,不限于风格化地标、地方限定表情包、错位混搭、方言入画,好看、能收藏、好玩、能传播的海报均可参赛。