TouchAll技术博客

TouchAll技术博客

[系统设计 - Agent 体系设计] 提示词工程 - 新手入门

提示词工程(Prompt Engineering)是一套规范化设计、调试、优化输入文本,用来精准控制大模型输出格式、逻辑、风格、能力边界的方法论,核心目标:降低模型幻觉、稳定输出、复用模板、挖掘模型极限能力。

整体分为基础理论、核心编写技巧、高阶范式、工程落地、调优运维、行业落地六大板块。

一、核心概念

1. 核心名词

  1. prompt(提示词): 用户输入给大模型的全部文本,包含指令、上下文、示例、约束、角色等;
  2. Completion: 模型返回的回答结果;
  3. 上下文窗口: 模型单次可读取的输入 + 输出总字数上限,长文本提示词设计首要约束;
  4. 幻觉: 模型编造虚假事实,提示词工程最重要的优化目标;
  5. 温度: 随机性参数, 0 = 严谨复刻、1 = 自由创作,提示词常配套参数控制。
  6. Top-K:大模型文本生成阶段的采样截断策略,属于模型生成参数,常和 Top-P、Temperature 配合使用,用来约束词语选词范围,控制输出随机性、发散程度。模型预测下一个字词时,会计算词表里所有候选 token 的概率,Top-K 即只保留概率最高的前 K 个 token,仅在这 K 个候选里随机采样生成下一个字,剩余低概率 token 直接丢弃。K=1:贪心采样,永远选概率最高的词,输出极度固定、死板、重复,逻辑严谨无脑洞,适合文案复刻、公式编写、精密代码、标准化报表;K=5~20:日常通用区间,兼顾流畅度与灵活度,问答、文案、分析首选;K>50:候选词范围大幅拓宽,内容天马行空,容易出现逻辑断裂、幻觉,多用于创意写作、脑洞剧本、艺术创作;K=0:关闭 Top-K 限制,全词库自由采样,一般不单独使用。
  7. Top-P: 不断从最高概率开始累加,当累积概率 ≥ 设定阈值 P,就停止收录,只在这一小批动态候选 Token 中随机采样生成文本,其余低概率字词直接舍弃。候选词数量不固定,会随上下文语义自动增减;P=0.1~0.3: 候选池极小,选词极度保守、刻板,语句重复率偏高,几乎没有发散。适用:公式编写、精密代码、标准化报表、法律条文、严谨数理推演。P=0.6~0.8(通用首选):平衡流畅度与灵活度,文本自然通顺,不会僵化,也不会胡乱编造。适用:日常问答、文章撰写、文案策划、知识科普。P=0.9~0.99: 候选池大幅扩容,随机性显著提高,想象力强,容易出现脑洞、轻微逻辑混乱、幻觉。适用:小说创作、剧本、脑洞创意、艺术文案。P=1: 无限制,全词库开放采样,一般不单独使用。

2. 提示词基础五要素(万能基础结构)

一套合格提示词必须包含 5 部分,简称RCITE 结构

  1. Role 角色:定义模型身份(专家、程序员、HR、医生、分析师);
  2. Context 上下文:背景资料、已知信息、历史对话、参考文档;
  3. Instruction 指令:明确要完成的任务(总结、改写、推理、代码、策划);
  4. Input 输入素材:待处理原文、题目、数据、需求文本;
  5. Expectation 输出约束:格式、长度、语气、禁止内容、评判标准。

二、基础常用提示词技巧(入门必学)

1. 零样本提示 Zero-shot

不给案例,仅凭自然语言直接下达指令。

示例:总结下面文章,精简到 100 字以内。

2. 少样本提示 Few-shot

2~5 个标准示例,让模型模仿格式、逻辑、文风,稳定性大幅提升,最日常实用。

结构:示例 1→示例 2→当前任务。

3. 思维链提示 CoT(Chain-of-Thought)

强制模型分步推理,解决数学、逻辑、计算题,大幅降低推理错误。

常用话术:一步步思考,写出推导过程,最后给出答案。

4. 自问自答 Self-Ask

让模型主动提问、补全缺失条件,适合信息残缺、模糊的复杂问题。

5. 格式限定

固定输出结构:Markdown、JSON、表格、列表、思维导图、代码块,对接自动化程序必备。

示例:最终结果严格输出 JSON 格式,仅返回 JSON,无多余解释。

6. 负面约束(禁语)

明确禁止行为:禁止编造数据、禁止啰嗦、禁止口语化、禁止发散闲聊、禁止提前收尾。

三、高阶主流范式(工业级专业方案)

1. 思维树 ToT(Tree of Thought)

把推理拆成多条分支路径,择优选择答案,适合决策、方案设计、博弈类难题。

2. 思维图 GoT(Graph of Thought)

在 ToT 基础上增加分支关联、回溯修正,复杂科研、商业分析使用。

3. 工具使用提示 ReAct

推理 + 行动结合,引导模型调用搜索、计算器、代码执行等外部工具,解决实时信息、复杂运算。

逻辑:思考→判断是否调用工具→工具返回结果→整合答案。

4. 自动提示优化 APE

让 AI 自动迭代改写自身提示词,批量优化模板,适合大批量标准化任务。

5. 角色深度设定:人格锚定

细化身份、阅历、性格、说话习惯、专业壁垒,比如:10 年量化交易分析师,只讲客观数据,不做主观预测。

6. 结构化提示框架

  1. CRISPE:角色 - 背景 - 指令 - 输出格式 - 补充约束;
  2. APE:目标 - 过程 - 预期结果;
  3. LEAP:限制 - 预期 - 行动 - 产出。

7. 拆解法:复杂任务拆分

长任务拆成多步骤子任务,分步执行,避免模型一次过载:

例:写调研报告 → 1 整理数据→2 分析问题→3 提炼结论→4 撰写文稿。

四、长文本提示词工程

针对长文档、书籍、海量资料场景:

  1. 滑动窗口分段:超长文本切割分批输入,汇总最终结果;
  2. 摘要递进压缩:先分段摘要,再汇总全文摘要;
  3. 检索增强 RAG 提示词:绑定知识库,优先参考给定资料回答,杜绝幻觉;
  4. 上下文压缩:精简冗余对话,节省窗口空间。

五、Agent 智能体提示词(前沿核心)

用于搭建自主执行 AI 助手,是当下提示词工程重点:

  1. 状态定义 State:记录任务进度、历史行为、目标清单;
  2. 工具描述 Docstring:清晰定义每个工具用途、入参、返回格式;
  3. 决策阈值:设定什么时候调用工具、什么时候结束任务;
  4. 记忆管理:短期上下文记忆、长期知识库记忆、反思复盘;
  5. 输出 Schema 强制约束:固定结构化输出,方便程序解析调度。

六、提示词调优、测试与运维

1. 调优流程

需求初稿 → 小样本测试 → 错误定位(幻觉 / 逻辑乱 / 格式错)→ 增加约束 / 示例 → 批量灰度测试 → 定稿固化模板。

2. 常见问题优化方案

  • 幻觉:增加 “仅使用给定资料作答,未知内容标注不清楚”;
  • 答非所问:强化指令,删减冗余内容;
  • 输出不稳定:增加 Few-shot 示例、固定格式;
  • 啰嗦冗长:明确字数、短句要求。

3. 批量工程化

  • 模板化:制作可复用 Prompt 模板,变量替换快速使用;
  • 版本管理:记录不同版本提示词效果,迭代存档;
  • 评测集:搭建标准化题库,量化打分,对比优劣。

七、安全提示词工程

  1. 对齐约束:价值观、法律法规、内容合规约束;
  2. 防注入:防御 Prompt 注入攻击,防止用户篡改角色与指令;
  3. 隐私保护:禁止泄露敏感信息、编造个人隐私;
  4. 脱敏话术:对敏感内容模糊处理。