提示词工程 - 认识 Temperature 温度
编辑首先 Temperature 代表大模型输出的随机性参数, 本章将用实验认识 Temperature 温度如何控制输出质量,为我们的目标任务设置使用合适的 temperature 区间,引导大模型达到我们的预期目标。
整体思路
核心目标:用标准化数据集 + 量化指标 + 对照实验,量化三组参数对「幻觉、稳定性、逻辑性、流畅度、发散度」的影响,摒弃主观感受,形成可复用的参数选型测试流程。
测试原则:单一变量原则,一次只改动一个参数,其余固定;基准对照组统一,多轮重复取均值消除随机波动。
一、前期准备:搭建测试基础环境
1. 固定不变基准条件
- 固定基础提示词模板全程不变(角色、指令、输入素材、输出格式、约束文案完全一致);
- 固定模型版本、上下文窗口长度;
- 固定采样轮次:每组参数统一生成 N=10~20 轮,结果取平均值,规避单次随机误差;
- 划分 3 类测试题库(覆盖绝大多数业务场景)
| 题库分类 | 用途 | 测试重点 |
|---|---|---|
| 严谨推理集 | 数学计算题、逻辑推理、客观知识问答、法条、代码编写 | 幻觉率、正确率、一致性 |
| 通用文案集 | 总结、科普、职场文案、记叙文 | 流畅度、逻辑连贯性 |
| 创意创作集 | 小说、脑洞文案、故事续写 | 发散丰富度、可读性 |
2. 设定 5 大核心量化评价指标(可落地打分)
| 指标 | 定义 | 打分区间 | 适用场景 |
|---|---|---|---|
| 准确率 Acc | 客观题目答案和标准答案匹配程度 | 0~100% | 数理、客观知识、代码 |
| 幻觉率 Hallucination | 编造不存在事实、错误数据、虚假概念占比 | 0~100%,越低越好 | 全场景通用 |
| 一致性 Consistency | 相同输入多轮输出重复、统一程度 | 0~100%,越高越稳定 | 报表、标准化输出 |
| 流畅度 Fluency | 语句通顺、无断句、无重复循环文本 | 0~10 分 | 文案、长文本续写 |
| 发散度 Diversity | 多轮回答内容差异化程度 | 0~10 分,越高脑洞越强 | 创意类场景 |
3. 打分落地方式
- 客观指标(准确率、幻觉率):脚本自动校验,正则、关键词比对、标准答案匹配;
- 主观指标(流畅度、发散度):LLM 打分(搭建打分 Prompt 做自动化评测)。
你是专业评测官,对照标准答案与约束要求,对下文从【准确率、幻觉、流畅度、一致性】四项每项0-10打分,仅输出JSON:{"准确率":x,"幻觉":x,"流畅度":x,"一致性":x} 评测标准: 准确率:答案贴合标准答案,完全正确10分,完全错误0分; 幻觉:无编造0分,大量编造10分; 流畅度:语句通顺无卡顿10分,重复乱码0分; 一致性:行文风格统一10分,前后矛盾0分。 待评测文本:{{回答内容}} 标准答案:{{标准参考}}
二、实验设计
参数设计
固定 Top-K=20、Top-P=0.7, 只改变temperature:
0,0.1,0.3,0.5,0.7,0.9,1.1,1.3
每组生成 N=20、统计各项指标
问题集设计
预期实验结果
- T≤0.3:准确率、一致性显著升高;幻觉、发散度大幅下降;极易出现文本重复、话术死板;
- T=0.6~0.8:流畅度最优,各项指标均衡,通用场景最优区间;
- T>1.0:发散度持续上升,幻觉、逻辑错误快速增多,准确率断崖下跌;
实验结果
实验结果预示
- 0
- 0
-
分享