拆解 Coze 2.0:技能、工作流与智能体到底有什么区别
2026 年 1 月 20 日,WaytoAGI 社区邀请罗文与二师兄(谭轶骅)两位嘉宾,围绕 Coze 2.0 的更新展开了一场近三个小时的深度对谈。罗文从概念层面梳理了技能(Skill)、工作流与智能体的本质区别,二师兄则带来了 3D 打印调参、中考作文辅导、外文文献解读等七个真实场景的技能开发案例。本文适合正在使用或准备上手 Coze 的开发者、产品经理,以及想通过技能市场变现的个人创作者阅读。
技能、工作流与智能体:一个本质,三种形态
罗文坦言,自己最初也对技能与工作流、智能体的区别感到困惑,经过两个月的深度研究,他给出的结论是:这四个东西本质上是一回事,只是在不同场景下的应用形态不同。
他建议用一个复杂度矩阵来理解:超级智能体(如阿里推出的“阿福”)复杂度最高,面向广泛场景;扣子智能体面向业务解决具体问题,复杂度适中;工作流是将原有 SOP 流程串联成流水线,适合复杂批量任务;而技能是最近热门的概念,搭建更简单,适合小白用户快速上手,但目前只能搭建相对简单的工作流。
“技能只是更方便小白用户快速地上手,”罗文强调,“以前搭工作流还得拖拉拽、试参数,这一步就拦下了大多数不爱学习的人。技能可以通过聊天快速生成一个简易的工作流。”但他也直言,对于需要稳定产出的场景,自己仍然倾向于使用工作流:“如果是要稳定产出的话,那我还是愿意拖拉拽。”
二师兄从结果稳定性角度补充了自己的体感:通用智能体每次给出的结果可能类似,但过程不可控,“它每一次都是自己自由发挥”;而技能有约定流程,相当于封装了一个思维链,每一步做什么都有约束,结果更符合预期。
技能的四个层次与变现机会
罗文将技能从简单到复杂分为四个维度,并指出不同层次的技能对应不同的商业机会:
第一层:纯指令型。 本质上就是一个系统提示词的封装,用户自己就能生成,没有变现空间。
第二层:资源型。 需要自己上传资料、搭建知识库,适合个人自用,但难以商业化。
第三层:工具集成型。 技能不仅可以完成任务,还能增加运算过程,复杂度更高。
第四层:接入 MCP 插件型。 技能可以调用外部插件,能力大幅扩展。罗文举例说,扣子技能商店里“参和老师”写的抖音提取文案技能就封装了插件,“一般的开发者、一般的使用者就弄不了了,这种就有机会”。
他建议官方将技能收费模式从订阅制改为次数制,因为“如果不算次数可能有点受不了”。对于想在扣子上挣钱的开发者,罗文给出的商业逻辑是:To B 沟通成本极高、能力要求极强,而面向 C 端只要价格便宜,市场可以无限放大。“以前做企业一个月做三个了不得了,价格降两个零,就可以做 300 万个人。”
二师兄的七个技能:从 3D 打印到中考作文
二师兄展示了他在扣子上开发的七个技能,其中六个已调试完成。这些技能全部源于个人真实需求,覆盖了硬件、教育和学术研究等多个领域。
3D 打印新手百科全书。 二师兄喜欢玩 3D 打印,但常遇到层纹、翘边、材料“炒面”等问题。这个技能会分析打印失败的原因,给出热端温度、切片软件参数(外墙速度、顶面速度、加速度、风扇调整)等具体调整建议。有一次问题反复出现,技能提示可能是 PETG 材料受潮了,并给出了烘干处理方法——烘干后重新打印,成品果然变得整洁。
3D 建模指导。 基于 Autodesk 的免费 3D 建模工具 Fusion 360,让 AI 帮忙搜集知识库、项目案例操作方式、操作基础指南和快捷键,整理成 reference 文档作为技能的知识库。
数学辅导。 针对初中数学题,技能会先拆解题目的已知条件、所需条件和结论,然后用 Python 生成可视化页面,实现“数形结合”的讲解效果。二师兄特别提到,扣子内置的豆包模型在中考数学题上的正确率“几乎是跟标准答案一模一样”,优于他此前测试的 DeepSeek 和 Kimi。
中考作文提分。 针对孩子写作文“不知道写什么、字数不够、没有好词好句”的痛点,技能按五个阶段工作:解析题目立意、视觉驱动找素材、搭建叙事框架、用过渡句衔接、最后从阅卷老师视角找出扣分点和加分点。以“转折的力量”为例,技能会给出三个写作角度供选择,生成四格漫画作为叙事大纲,并提供转场金句、好词好句和名言警句。二师兄说,孩子按这个流程写出来的作文,“至少也能拿到 45 分到 48 分左右”。
外文文献解读。 这个技能可以搜索学术论文(通过 arXiv API 下载)、进行 OCR 识别、提取摘要、解读研究方法和论证过程,还能复现论文中的代码并用 HTML 或 Python 演示效果。二师兄用它找到了六足机器人步态算法领域 2020 年的一篇关键论文,完成了深度解读。
现场问答
Q:做商业计划书(BP)技能,应该拆成多个技能还是一个技能封装所有板块?
二师兄建议将各板块能力分开做不同的技能,因为专业 BP 需要的上下文量非常大,一个技能封装过多功能会导致效率问题。他的思路是“工作流 + 技能”结合:用工作流调用不同技能,一步步完成 BP 文件。罗文补充说,技能可以携带知识库(reference),但复杂工作场景中工作流的稳定性更好。
Q:工作流读取 PDF 准确率低,怎么解决?
罗文推荐上海 AI 实验室开源的 MinerU(音“Manu”),称其 PDF 解读效果好,有 API 可以接入,自己写个插件调用即可。二师兄补充说 MinerU 也可以本地部署。此外,PDF 解读要区分两个层面:OCR 提取文字和图片理解,后者需要多模态模型。
Q:如何理解城市规划设计图这类专业图片?
罗文建议尝试谷歌 Gemini 或豆包视觉大模型,关键是定义好理解的维度——“你是理解它的交付层、交付逻辑,还是文字、排版、色系?”对于需要理解动线设计、人流拥堵等专业问题的场景,他认为目前国内工具在设计院汇报阶段比较实用,但“太专业了,可能涉及到本身要训练很多维度”,本地部署训练对一般公司来说不太现实。CAD 图纸方面,装修类应用已有人使用,但建筑类因涉及力学等专业知识,目前还不行。
Q:多个技能能否拼装到一起,写入智能体或工作流?
罗文介绍了“预识别”机制:在开发智能体的界面中,可以添加多个插件、工作流或技能,大模型层面设定了规则——每次执行时先阅读每个插件或工作流的说明文档,再决定调用哪个。“以前需要人告诉 AI 什么时候该调什么插件,现在只要技能说得明白它是干嘛的,AI 就可以直接调用了。”技能、插件、工作流本质上都是业务流程,只是属性标签不同。
Q:引用别人的收费技能,消耗的是谁的积分?
罗文表示不确定,需要问官方。他提到技能有 7 天免费期,目前难以看出积分消耗情况。有观众反馈用扣子编程会扣积分,但用扣子空间似乎不扣。
Q:工作流中,文生视频生成的 URL 传给豆包视觉模型无法识别怎么办?
钱星宇遇到这个问题:视频 URL 被模型识别为字符串,但下载后以视频模式上传就能识别。罗文建议在节点中检查参数设置,或加入扣子交流群直接 @ 官方人员询问。
Q:旧版扣子中做的插件、工作流能否在新版中复用?
赵琛宇关心旧资产重用问题,特别是 SQL 与工作流调用未打通。罗文确认目前两者还没打通,表示会向扣子产品老师反馈。赵琛宇还提出了企业版需求:给每个员工配账号创建技能,然后由管理者把员工的技能串成工作流,形成虚拟团队协作——罗文认为这是很好的需求。
现场演示:用 PRD 方法写技能
罗文现场演示了从零创建一个“历史思辨教案”技能的过程,对比了两种描述方式的差异。
第一种是简单描述:“生成一个历史的思辨教案。”第二种是先用豆包生成一份 PRD(产品需求文档),包含产品定位、核心价值、适用场景、用户画像、核心功能需求、非功能需求、AI 能力和收敛标准。
“PRD 这三个词大家记一下,养成习惯以后,这个方法可以让你的提示词质量提升 90% 以上。”罗文强调。两种方式同时生成,PRD 版本产出的技能明显更精准、规范。
罗文还展示了扣子自带的写作技能:在对话中 at 一个文件作为上下文,再 at“写作”技能,说一句“帮我针对想从事 AI 自媒体的小开发者写篇公众号文章”,扣子就直接生成了排版精美的长图文,甚至自带公众号编辑器。“以后可以日更了,这太简单了。”他感慨道。
要点回顾
- 技能、工作流、智能体本质相同,都是业务流程的不同形态,区别在于复杂度、稳定性和使用门槛。技能适合小白快速上手,工作流适合复杂任务的稳定调优。
- 技能分为四个层次:纯指令型、资源型、工具集成型、接入 MCP 插件型。开发者的变现机会集中在第三、四层。
- 技能可以携带知识库(reference),让 AI 在回答时自动检索参考资料,提升回答质量。
- 写技能用 PRD 方法:先让 AI 生成产品需求文档,再基于 PRD 创建技能,提示词质量可大幅提升。
- 扣子定位是“职场人的第一 AI 应用”,面向知识工作者;扣子编程则针对生产力工具,解决更复杂的问题。
- 长期计划功能可以将复杂任务拆解成节点,自动生成可编辑的高质量 PPT,适合做课程、写方案等场景。
- 定时任务(团队版功能)可以定点完成重复工作,如每天定时推送 AI 新闻。
- PDF 解读推荐 MinerU,图片理解推荐 Gemini 或豆包视觉大模型,关键是定义好理解维度。
- 技能市场是新的分发渠道:开发者可以将技能作为引流产品,未来平台大概率会推出“联系开发者”功能。
- 实践建议:每天用扣子一小时,做 4 个同款案例;关注微推 API 等精准信息源,少看以流量为目标的自媒体。
直播回放约 165 分钟
播放器来自飞书妙记 · 在新窗口打开