千问 Image 技术拆解:中文渲染突破、提示词实战与海报创作灵感
8 月 28 日的 WaytoAGI 晚八点共学直播中,通义千问团队算法工程师吴晨飞博士与三位海报创作大赛选手,围绕千问 Image 模型的技术突破、应用场景与创作实战展开分享。本文适合 AI 绘画创作者、设计师以及对文生图模型技术原理感兴趣的读者,内容涵盖模型核心能力、提示词使用技巧、衍生应用案例与比赛创作思路。
原生中文渲染:千问 Image 的核心突破
吴晨飞博士在分享中明确指出,千问 Image 模型最核心的技术突破是「原生文字渲染能力」。此前文生图模型在处理中文时普遍存在痛点:小字模糊不清、字数一多就容易花掉。团队针对这一问题,从数据合成和模型设计两方面进行了攻关。
在数据层面,团队设计了复杂的数据处理流程,以获得带有文字渲染的优质训练数据。在模型设计层面,采用 OCR 能力强的轻 2.5 VO 编码文本,并使用 20B 的 MMDIT 模型对文本和图像进行整体注意力处理,同时采用双流结构提升细粒度文本控制力。
这一突破带来的差异化优势十分明显。在诸多测评中,千问 Image 的一级汉字准确率高达 97%,而对比模型 GBD 4 仅为 68%;二级汉字准确率为 41%,GBD 4 为 16%。吴晨飞博士将这一能力概括为「易字稳、难字能写」——常用字稳定生成,生僻字多次尝试也大概率能生成,甚至可以通过图像编辑能力修改字的偏旁部首。
此外,千问 Image 是目前性能最好的开源模型,在 LM Arena 竞技场的文生图和图像编辑榜单上均排名靠前,采用 Apache 2.0 license 允许商用,训练和使用过程中无水印。在与 Nano Banana 的对比中,千问 Image Edit 在风格化方面表现更优,Nano Banana 官方博客的对比图显示,在风格化类别上,千问 Image Edit 的分值更高,该模型还可去除 Nano Banana 生成图像上的水印。
提示词使用技巧:让模型输出更可控
吴晨飞博士强调,提示词非常关键,本质是区隔数据、集中想要的优质数据。不同模型因训练数据不同,所需提示词也有差异。他分享了几个具体的使用技巧:
保持训练推理一致。 以生成文字为例,训练数据中带有文字的数据大多用引号引起来,所以推理时写提示词也应用引号括起文字,避免训练和推理出现差距。
避免使用否决词。 提示词中应避免出现「不要生成什么什么」等否决表述,以免影响生成效果。
明确文字位置和风格。 描述文字位置时,复杂逻辑用相对位置法更稳定,简单明确位置可用绝对位置法;写提示词时最好明确风格,如纪实摄影风格等,且提示词本身要一致,避免冲突。
详细清晰描述。 提示词应详细清晰,避免模糊表述,如明确邀请函上的名字和日期等信息,详细描述画面内容、主体特征等,能提高生成效果。
应用场景与衍生项目:从海报到手办
千问 Image 模型在海报创作中应用广泛,因其一级汉字准确率高,能自然地将文字和图像组合在一起,无需过多排版,许多 up 主已用其制作封面。千问的吉祥物卡比巴拉的相关图像很多是用千问 Image Editor 创造的,运营同事表示工作效率得到了极大提升。
吴晨飞博士还分享了一些基于千问 Image 的衍生产品和项目:Instant X 做的 Control Net 可使图像风格修改更稳定;麦桔做的麦桔美人 Lora 能提升人像生成效果;还有 AW Portrait 等优秀的 Lora 项目。
在具体应用案例方面,千问 Image Edit 可通过合理设计提示词轻松做出手办效果,提示词需清晰描述将照片转化为角色形象、建模过程等内容。通过简单提示词「generate the front view, left view, right view, back view」可实现多视图生成,在未来 3D 建模中有很大应用潜力。该模型还能将输入的字体变成 3D 效果并悬浮在街道上,渲染能力强,能处理好空间漂浮感和背景模糊等效果。
图像组合与迁移方面,万物迁移项目可将衣服、鞋等迁移到模特身上,也可将广告产品图贴到模特手上,在广告设计等领域有实际应用价值。千问的 Twitter 官方账号上还分享了线稿上色案例,传统渲染速度慢,若该模型渲染效率和效果进一步提高,将对设计师有很大帮助。此外,模型还可进行 out painting、in painting、图像打光等操作。
一个有趣的案例是图像编辑结合世界知识:通过输入「顺着红色箭头的方向会看到什么」,模型能直接在图片上生成箭头并指向相应物体,展示了图像编辑结合世界知识的应用潜力。
训练经验:坚持与选型
吴晨飞博士分享了团队在训练文生图模型时的经验。文字效果起初很差,早期尝试直接喂文字数据,出现图片中文字模糊、多余等问题,尤其是中文效果更差。但团队坚持解决文字问题,认识到训练需要耐心,文字效果会逐渐提升,存在一个泛化的临界点,达到该点后模型就能较好地生成文字。
在模型设计时,使用轻 2.5 VO 这一 OCR 能力强的编码器,为解决文字问题带来了很大收益。这一选型决策被吴晨飞博士视为关键。
选手创作分享:三种思路
三位海报创作大赛选手分享了各自的创作思路。
俊是投稿量最多的选手,创作了以广州为主题的海报。他考虑到广州既是现代化大都市又有深厚传统文化,在海报中运用广州塔、红灯笼、小猫等元素,通过冷光与暖光的搭配,配合文案「城市的光,一半照着未来,一半暖着过往」,体现广州的特色。他避开常见的大城市现代形象,选择老广州文化符号,如广式月饼、广东凉茶等,并通过 AI 模仿民国作家笔法写提示词,提高了创意实现效率。他认为千问 Image 模型在国内图片生成能力首屈一指。
笨笨最初想将 AI 与古代结合创作西安挖掘图,但因其他城市场景构思困难,改为谐音梗方式。他选择谐音梗是为了更好体验通义模型的文字效果,且符合当下年轻人喜好。他写提示词有固定格式:先写文字内容,包括主标题、副标题和装饰文字,再描述画面,包括风格、色彩、细节等,最后明确文字位置。他还将千问 3235B 与千问 Image 模型结合使用,先由前者输出谐音内容,再用后者生成文案和图片。
迷人的小赫敏的三张海报分别学习了茶颜悦色手卡设计、生成摄影作品和报纸样式海报设计。她通过人机协作,拆解茶颜悦色手卡元素,用结构化提示词复现手卡;运用产品特写、背景虚化和文案设计制作美食宣传海报;用 GPT 提取景区报纸设计框架,用千问复现报纸海报,输入关键词可稳定输出带有搞笑文案的同款报纸。
现场问答
千问 Image 后续是否推出更小 size 适配移动端? 吴晨飞博士表示团队有在探索,但面临文字能力能否在小 size 下保持可用效果的挑战。模型目标是做能用、好用且有中国文化和中文渲染能力的模型。
如何用气象预报图做新媒体海报? 这是复杂任务,需借助额外工具提取地图有效区域,用千问 Image 为海报打底并设计文字,再进行风格融合。可尝试将抠出的地图贴到海报对应位置,或进行多图输入,使其自然融入新背景。
如何描述文字位置? 复杂逻辑推荐使用相对位置法,通过定义文字间的逻辑上下左右关系,让模型进行整体排布;简单明确位置可用绝对位置法,如描述左上角、右上角等。
中英文提示词有区别吗? 若生成中文文字、中国场景或元素,使用中文提示词更好;若生成英文文字渲染,则用英文提示词更佳;中英文混合时,根据比例选择。
要点回顾
- 千问 Image 的核心突破是原生中文文字渲染能力,一级汉字准确率达 97%,追求「易字稳、难字能写」
- 模型采用 Apache 2.0 license 开源,允许商用,训练和使用无水印
- 提示词技巧:文字用引号括起、避免否决词、复杂位置用相对位置法、明确风格、描述详细清晰
- 应用场景覆盖海报创作、IP 创作、手办生成、多视图生成、艺术字体编辑、图像迁移、线稿上色等
- 训练经验:坚持解决文字问题,存在泛化临界点;选型 OCR 能力强的编码器带来收益
- 比赛主题为「地方风物」,设优胜奖、创意奖、优秀奖、传播奖及 30 份周边大礼包