从写好一段提示词开始,成为你行业里的 AI 专家
这节课讲清楚了三件事:提示词分哪几种、系统提示词怎么写、以及如何科学地迭代它。讲师给出了可直接套用的写作模板和迭代方法,也解释了为什么“懂行业 + 会 AI”的人在未来最值钱。听完你能带走一套写提示词的具体步骤,以及一个判断自己是否在进步的标准。
先分清三种提示词:用户、系统与原提示词
很多人以为提示词就是跟 AI 聊天时输入的那句话。讲师说,这句话只是其中一种,叫“用户提示词”(user prompt)。你让豆包写周报、做 PPT、生成图片,发送的这些指令都是用户提示词。
但如果你想“造一个豆包”,而不是“用豆包”,关键在第二种:系统提示词(system prompt)。它相当于模型的行为手册、员工规范——规定这个 AI 是什么性格、能干什么、不能干什么、按什么规则做事、以什么格式输出。讲师举例说,豆包有时会拒绝回答某些问题,理由是安全或道德,就是因为它的系统提示词里写了这些限制。
第三种叫“原提示词”(meta prompt),也就是“写系统提示词的提示词”。你不需要一个字一个字去写系统提示词,把原提示词模板发给豆包、DeepSeek、Kimi 或千问,AI 会反过来引导你,像挤牙膏一样把你脑子里的需求一点点问出来,最终生成一份系统提示词。
讲师强调,这三者的关系是:用户提示词是你使用 AI 时发送的消息;系统提示词是让模型知道“我是谁、我能干什么”的规范;原提示词是引导 AI 帮你写系统提示词的那段话。这节课的核心,就是教大家怎么写好系统提示词。
新手写提示词常犯的两个错误
第一个错误是“言之无物”。讲师模仿了一些人写提示词时的样子:“我们要上升到战略级别”“对齐一下颗粒度”“打通赋能业务的生产闭环”——说了一大堆,但 AI 根本不知道你要干什么。这类空话套话,在提示词里毫无价值。
第二个错误更普遍:用模糊的形容词。比如“帮我写一篇好的文章”“写一篇优秀的文章”“写一篇有流量的文章”。问题在于,你没有告诉 AI 什么是“好”、什么是“优秀”、什么是“有流量”。讲师解释,通用大模型在训练时,目标是无论用户输入什么,都输出一个 60 分及格水平的内容,而不是在某个领域做到 10 分、在另一个领域只做 2 分。所以你跟它说“要好一点”,它只会给你 60 分的东西。
正确的做法是:把背景信息、参考资料、具体要求都给它。比如你要写一篇财经自媒体文章,就把你之前的讲义、你欣赏的爆款文章、你希望避免的写法,全部提供给 AI。这就营造了一个“语境”——讲师提醒,这个词在 AI 工程里叫 context(上下文)。
写系统提示词的六个组成部分
讲师给出了一个最简单的系统提示词结构,共六步:
第一,角色。告诉 AI 它要扮演谁——医生、法学顾问、编剧,还是 AI 老师。就像玩剧本杀,先定角色,再遵循这个角色的规则。
第二,任务。明确它要完成什么。比如“协助人类理赔员审查汽车事故报告,提供分析报表和草图,总结事故经过并给出初步判断”。
第三,背景信息。把你手头的资料给它。讲师举例:一个小学老师不想出题了,可以把以前出过的 10 份卷子全部发给 AI,让它总结出题风格和难度分布,再出一份新卷子。有了这些上下文,AI 输出的准确率会明显提升——讲师说,不给背景信息成功率大概 30%,给了能提升到 60%。
第四,分布指令(step by step)。告诉它第一步做什么、第二步做什么。注意,这里说的是“做什么”,不是“想什么”——讲师特别区分了思维链(COT)和工作流(workflow):COT 是引导模型一步一步思考,而 workflow 是告诉它一步一步执行。现在模型能力提升了,很多思考能力已被内化,不太需要你手动写 COT;但你在给智能体写规范时,仍然要告诉它面对复杂任务先做哪步、再做哪步。
第五,准则和约束。明确它能干什么、不能干什么。比如“你可以说你不清楚,但不要瞎编”——这是应对模型“幻觉”的有效手段。幻觉是大语言模型因为预测下一个字而必然出现的现象,质量低的模型幻觉率更高,所以要在提示词里明确禁止编造。
第六,输出格式。指定它输出的格式是 Markdown、JSON 还是纯文本。讲师解释,Markdown 可以理解为一种比 Word 更规范的文本格式,AI 读起来更舒服;JSON 则是智能体之间传递信息的标准格式——第一个智能体输出 JSON 文本,第二个智能体才能精准读取。至于 XML,讲师说这是 Claude 模型的“母语”,用 XML 格式写提示词给 Claude,成功率比 Markdown 高约 10%;而千问系列模型用 Markdown 效果最好。
用原提示词模板起步,再科学迭代
听完六步结构,很多人会担心自己写不出来。讲师说不用担心,他会提供一份原提示词模板,每次写系统提示词前,先把这段模板复制给 AI,告诉它你要写什么领域的系统提示词,AI 会一步步问你问题,帮你把需求补全。
拿到第一版系统提示词后,迭代方法很关键。讲师给出了一个三步循环:
第一步,立刻“PUA”它。不用细看第一版,直接说“你写的是啥?你再好好想想我的需求”。AI 会回溯需求、承认不足、重新生成——恭喜你,有了第二版。但注意,PUA 只能一次,次数多了它会越想越糟。
第二步,新开一个对话测试。把第二版系统提示词加载进去,让它真正去干你要干的活。比如写一篇财经文章,看结果好不好。
第三步,指出问题,让它原地改正。这一步有个常见陷阱:AI 会“打补丁”。比如你要求“不要出现非金融领域的专业名词”,它不出现金融名词了,又开始出现计算机名词;你让它改,它不出现计算机名词了,又冒出商业名词。问题根源在于最初那版提示词里的问题没被修正,只是不断叠加补丁。所以你要明确告诉它:“彻底定位到原系统提示词中的问题,改正这些问题,生成新的 V3 版本。”
讲师提醒,一个提示词要上商用环境,至少要迭代 100 个版本;要稳定好用,300 个版本以上。但日常写个公文、发个红头文件,迭代 20 个版本就够用了。
用评测基准判断提示词好坏,而不是凭感觉
迭代了这么多版本,怎么知道哪个版本更好?不能靠肉眼判断——人本来就不理性,半年前觉得好的文章,半年后可能觉得是“一坨狗屎”。所以要建立科学的评估方法。
具体做法是:先确定用哪个模型,再基于这个模型迭代提示词。比如你想写剧本,有豆包、千问、Kimi、智谱、DeepSeek 五个模型可选,那就准备 20~30 条同样的测试指令,分别发给每个模型,然后打分。
打分分两种:机器打分和人工打分。机器打分要用最好的模型当裁判(讲师称为 SOTA 模型),而且这个裁判本身也是一个智能体——你得给它写一个系统提示词,把打分标准、守则写清楚,它才知道怎么打分。人工打分则要请对应领域的专家,比如评短剧剧本,就要请写过爆款短剧的编剧,而不是电影编剧。
打分维度通常有十几个到三十几个。讲师展示了一份脱敏的评测表:剧本理解、美术完整度、镜头拆解能力、画面调度能力、可拍性、交付效率、交付稳定程度……每个维度一个分数,不同模型横向对比。这样就能一目了然地看出哪个模型最适合你的任务。
模型定下来之后,才开始迭代系统提示词。这本质上是一个控制变量法:模型不变、输入的问题不变,如果输出变了,那一定是提示词的问题。有了这套可量化的评测基准,就不会出现“迭代 300 轮还不如前 50 轮”的情况。
讲师特别提到,这个能力对应大厂里一个专门的岗位——模型策略产品经理,负责建评测集、打分、指导模型训练方向。现在打开招聘软件搜这个岗位,薪资不低;DeepSeek 也在招兼职,据说 500 元一天。不需要会编程,只需要把你真实的工作场景拆分成不同维度,想清楚“因为哪几个标准满足,所以这是一篇好公文/好判决书”。
要点回顾
- 提示词分三种:用户提示词(你跟 AI 说的话)、系统提示词(定义 AI 身份和行为的规范)、原提示词(引导 AI 帮你写系统提示词的模板)。
- 新手写提示词的两个坑:说空话套话、用模糊形容词。要给 AI 具体背景和明确标准,它才能输出 60 分以上的内容。
- 一个最简单的系统提示词包含六部分:角色、任务、背景信息、分布指令、准则约束、输出格式。
- 大语言模型有注意力缺陷,会优先关注长文本的开头和结尾,所以重要信息要放在提示词的开头或结尾。
- 迭代提示词的三步法:PUA 一次让它重写 → 新开对话测试 → 指出具体问题让它原地修正,而不是打补丁。
- 判断提示词好坏要靠评测基准:同一批测试指令发给不同模型,按多个维度打分,先定模型再迭代提示词。
- 把行业知识“蒸馏”成系统提示词,你就拥有了这个领域的 AI 智能体;懂行业又懂 AI,才是未来最值钱的人才。
直播回放约 100 分钟
播放器来自飞书妙记 · 点击正文里的章节卡可跳到对应时刻 · 在新窗口打开