TouchAll技术博客

TouchAll技术博客

提示词工程 - 认识 Temperature 温度

首先 Temperature 代表大模型输出的随机性参数, 本章将用实验认识 Temperature 温度如何控制输出质量,为我们的目标任务设置使用合适的 temperature 区间,引导大模型达到我们的预期目标。

整体思路

核心目标:用标准化数据集 + 量化指标 + 对照实验,量化三组参数对「幻觉、稳定性、逻辑性、流畅度、发散度」的影响,摒弃主观感受,形成可复用的参数选型测试流程。
测试原则:单一变量原则,一次只改动一个参数,其余固定;基准对照组统一,多轮重复取均值消除随机波动。

一、前期准备:搭建测试基础环境

1. 固定不变基准条件

  1. 固定基础提示词模板全程不变(角色、指令、输入素材、输出格式、约束文案完全一致);
  2. 固定模型版本、上下文窗口长度;
  3. 固定采样轮次:每组参数统一生成 N=10~20 轮,结果取平均值,规避单次随机误差;
  4. 划分 3 类测试题库(覆盖绝大多数业务场景)
题库分类 用途 测试重点
严谨推理集 数学计算题、逻辑推理、客观知识问答、法条、代码编写 幻觉率、正确率、一致性
通用文案集 总结、科普、职场文案、记叙文 流畅度、逻辑连贯性
创意创作集 小说、脑洞文案、故事续写 发散丰富度、可读性

2. 设定 5 大核心量化评价指标(可落地打分)

指标 定义 打分区间 适用场景
准确率 Acc 客观题目答案和标准答案匹配程度 0~100% 数理、客观知识、代码
幻觉率 Hallucination 编造不存在事实、错误数据、虚假概念占比 0~100%,越低越好 全场景通用
一致性 Consistency 相同输入多轮输出重复、统一程度 0~100%,越高越稳定 报表、标准化输出
流畅度 Fluency 语句通顺、无断句、无重复循环文本 0~10 分 文案、长文本续写
发散度 Diversity 多轮回答内容差异化程度 0~10 分,越高脑洞越强 创意类场景

3. 打分落地方式

  1. 客观指标(准确率、幻觉率):脚本自动校验,正则、关键词比对、标准答案匹配;
  2. 主观指标(流畅度、发散度):LLM 打分(搭建打分 Prompt 做自动化评测)。
你是专业评测官,对照标准答案与约束要求,对下文从【准确率、幻觉、流畅度、一致性】四项每项0-10打分,仅输出JSON:{"准确率":x,"幻觉":x,"流畅度":x,"一致性":x} 评测标准: 准确率:答案贴合标准答案,完全正确10分,完全错误0分; 幻觉:无编造0分,大量编造10分; 流畅度:语句通顺无卡顿10分,重复乱码0分; 一致性:行文风格统一10分,前后矛盾0分。 待评测文本:{{回答内容}} 标准答案:{{标准参考}}

二、实验设计

参数设计

固定 Top-K=20、Top-P=0.7, 只改变temperature:
0,0.1,0.3,0.5,0.7,0.9,1.1,1.3
每组生成 N=20、统计各项指标

问题集设计

预期实验结果

  • T≤0.3:准确率、一致性显著升高;幻觉、发散度大幅下降;极易出现文本重复、话术死板;
  • T=0.6~0.8:流畅度最优,各项指标均衡,通用场景最优区间;
  • T>1.0:发散度持续上升,幻觉、逻辑错误快速增多,准确率断崖下跌;

实验结果

实验结果预示