跳到正文

让智能体“能听会说”:卡片、图片、语音全覆盖的多元交互实战

讲师 吕昭波 · 20:00 直播

这场直播是 WaytoAGI「AI 智能体训练营」第二期的第六课,由吕昭波主讲,围绕一个贯穿始终的「北京旅游助手」案例,完整演示了如何用扣子(Coze)平台为智能体加上可视化卡片、图片生成和语音交互能力。适合正在学习扣子、想把智能体从“纯文字对话框”升级为“图文音并茂”的入门和进阶学习者。

从“翻车”到“不翻车”:北京旅游助手的升级思路

吕昭波延续了前几节课的「北京旅游助手」案例。他坦言上一节课这个案例“翻车”了,聊到晚上 11 点多,这次吸取教训,提前打开了相关网页做准备。

这节课的目标很明确:在已有提示词、知识库和记忆功能的基础上,补齐多元交互模块——加背景图、生成图片、加入语音,让智能体“看起来更加美观,交互起来也会更好,而关键是它并不难”。

开场时,一枚扣子展示了用飞书多维表格搭建的企业级应用案例,包括多平台数据分析、AI 硬件商品监控等,里面包含 20 多个工作流级别的智能体。他以此给学员打气:“不要限制自己的想象力,要去用最轻量级的解决方案去做到企业交付。”吕昭波也补充说,这类模板“做好一套大概能卖个几万块钱是很正常的”,但关键在于“你背后的业务逻辑和你的智能体以及你的数据质量”。

扣子卡片:让回复从文字变成“商品橱窗”

卡片交互是这节课的重点之一。吕昭波强调,添加卡片的作用是“避免所有的回复只是文字,应该让他回复得更好、更直观”。如果只是文字介绍一大堆,用户没有直观感受;如果直接生成一张美味的北京烤鸭图片,“可能我们就已经开始流口水了”。

绑定卡片的操作路径:在扣子平台的工作流页面,鼠标移到工作流上,点击「绑定卡片数据」。选择官方提供的卡片样式后,需要配置参数——通常包括标题、描述和图片三个字段,这些参数来自工作流结束节点返回的变量。例如,图片字段可以绑定返回的图片 URL 变量(如 output),标题和描述可以绑定其他返回参数。

卡片还支持添加跳转按钮。吕昭波演示了如何配置“去买票”“去组团”等按钮,每个按钮可以绑定一个链接(如百度或自己的网站)。这样用户点击卡片就能跳转到购票页面、景区页面等,相当于一个轻量级的“美食商城”或“旅游服务台”。

他提醒,卡片适合旅游推荐、个性化推荐、背单词等场景。比如输入“apple”,卡片可以同时展示单词、图片和发音,让学习更直观。

图片生成工作流:从单节点到大模型扩展

图片生成部分,吕昭波回顾了薛老师之前讲的工作流知识,并现场演示了两种搭建方式。

方式一:直接使用模板。创建工作流后,选择底部的「生成封面图」模板,填写内容、提示词等参数,试运行后即可发布。这种方式最简单,适合快速上手。

方式二:手动搭建。添加「图像生成」节点,配置输入变量(如 input),在提示词中限定风格(如“符合北京旅游的景点或者美食的风格”),结束节点返回图片数据。吕昭波特别演示了结束节点可以返回多个参数(如 datamessage),并解释了如何检查各节点的输入输出。

进阶技巧:用大模型扩展提示词。直接让图像生成节点处理用户输入,效果可能不稳定。吕昭波演示了在开始节点和图像生成节点之间插入一个大模型节点,让大模型把“北京长城”这样的简短输入扩展成一段详细的提示词,再交给图像生成。他提醒,这样会“模型思考的时间会比较长”,如果追求速度,可以用非思考模式。

他还介绍了图像生成节点的参数细节:可以选择不同模型(通用、人像、动漫、油画、3D 卡通等)、调整宽高比(16:9、9:16 等)、设置正向提示词和负向提示词(比如给小朋友生成图片时,排除“大人风格的元素”)。

语音交互:从 TTS 到音色复刻

语音部分,吕昭波演示了通过工作流生成语音的完整流程。

基础 TTS 工作流:添加「TTS」节点(语音合成),配置三个关键参数——认证(相当于付费后获得的密钥)、音色(有默认值)、文字(要转成语音的文本)。开始节点接收用户输入,TTS 节点转成语音,结束节点返回音频 URL。

让语音更自然:直接让 TTS 读用户输入的文字,效果会比较生硬。吕昭波演示了同样插入一个大模型节点,让模型把输入扩展成 200 字的“发布会台词”,再交给 TTS 生成。他现场让“雷布斯”音色发布了一场“羊蝎子火锅小米外卖”发布会,效果颇具感染力。

SSML 语音合成标记语言:针对“声音生硬、没有换气”的反馈,吕昭波介绍了 SSML。通过在文本中插入标记,可以控制数字读法(如“2”读作“两”还是“二”)、添加停顿(如 <break time="500ms"/>)、标注重音等。他举例说,“中国的煤都是黑的”和“中国的煤都是哪里”这类歧义句,通过标记可以让 AI 读得更准确。

音色复刻:扣子支持复刻自定义音色,但需要开通团队版。操作路径是:切换到团队版 → 左侧资源库 → 音色 → 添加/复刻。可以录制自己的声音,也可以上传 10~30 秒的音频文件(MP3、MP4、WMA 均可)。复刻成功后,在智能体的音视频设置中,把中文音色切换为“资源库的音色”即可使用。吕昭波特别提醒版权问题:“最好是用自己的声音,不要用别人的,就是有这方面的一些风险。”

扩展场景:从单智能体到多智能体组合

课程后半部分,吕昭波展示了如何把多个智能体组合成更复杂的应用。

他演示了一个 AI 短剧生成平台:前端用 Tree、Coder 等 AI IDE 生成页面,后端调用扣子发布为 API 的多个工作流——每个角色(编剧、摄影、美术等)对应一个智能体,分别负责生成人物小传、角色图片、分镜头等。他强调“难点就是把所有的都协调在一起”,但思路是清晰的:每个智能体只做最小功能点,通过网页编排组合起来。

他还展示了一个模拟“斯坦福小镇”的多智能体对话网页:输入一个话题(如“北京烤鸭”),四个智能体轮流讨论。虽然现场有智能体响应失败(“三缺一”),但他借此说明:多智能体模式在扣子中“用的人感觉不是太多”,企业交付时他更倾向于“自己做网页,自己去编排,自己加反思的模式”,把每个扣子智能体做得越小越好,“越做复杂的功能它越不稳定”。

现场问答

飞书多维表格能不能作为知识库添加? 可以。创建知识库时选择飞书方式,把文档或表格加进来即可。

添加卡片的作用是什么? 避免所有回复只是文字,让信息展示更直观。适合旅游推荐、个性化推荐、背单词等场景。

工作流搭建太快了,能再展示一下吗? 操作不复杂:点击添加工作流,进去后选择模板或手动添加节点,配置参数后试运行、发布即可。

生成图片时提示词怎么写更好? 可以用大模型节点先扩展提示词,让模型把简短输入扩展成详细描述,再交给图像生成节点。注意正向提示词(要什么)和负向提示词(不要什么)的配合。

要点回顾

  • 卡片交互:在工作流上绑定卡片数据,配置标题、描述、图片三个参数,支持添加跳转按钮,让回复从纯文字变成图文卡片。
  • 图片生成:两种方式——直接用模板,或手动搭建「图像生成」节点;进阶做法是插入大模型节点扩展提示词,再交给图像生成。
  • 语音生成:TTS 节点需要配置认证、音色、文字三个参数;用大模型扩展文字内容可以让语音更丰富。
  • SSML 标记:通过语音合成标记语言控制数字读法、停顿、重音,让 AI 声音更自然。
  • 音色复刻:需开通团队版,在资源库中上传 10~30 秒音频复刻,注意版权风险,建议用自己的声音。
  • 多智能体组合:每个智能体只做最小功能点,通过网页(Tree、Coder 等 AI IDE)编排组合,可以做出短剧生成平台、多智能体讨论等复杂应用。
  • 作业:入门同学设置背景图、使用扣子卡片、开启语音交互;进阶同学用工作流生成声音、同时生成两种不同风格的图片。

直播回放202 分钟

播放器来自飞书妙记 · 在新窗口打开