[系统设计 - Agent系统设计专题] 1. Agent工程评估体系
编辑建立评估体系的目的
- 保证迭代优化效果
- 客观衡量模型能力水平:使用可量化的标准,客观衡量模型在各种任务优劣
- 通过评估体系验证改动是否有效,防止更新模型对Agent工程后能力退化
- 匹配真实业务需求
- 适配业务任务,通用基准无法代表行业场景,自建业务测评集,校验模型能够胜任
- 作为决策依据,不再依靠厂商宣传或少量样例测试
- 规定上线准入标准
- 保障合规与安全
- 识别隐形风险,检测幻觉、偏见、歧视、隐私泄露、违规内容生成等安全问题
- 满足合规要求
- 工程成本管控
- 性能与成本权衡,评估吞吐、延迟、显存占用、推理成本,横向对比找到效果达标下成本最优的方案
- 定位瓶颈,是模型能力不足、提示词问题、 上下文工程缺陷还是Agent架构问题
- 建立统一评价共识
- 统一团队内评判标准,消除研发、产品、业务人员 “各说各话” 的认知分歧;形成可沉淀的评测资产、评测流程,建立标准化 AI 研发流程。
如何建立评估指标
基础大模型原生评估指标
- 传统 NLP 指标(适合有标准答案场景,不适合开放问答、推理场景)
- Exact Match: 输出和标准答案完全匹配
- F1 Score: 字符/token 重叠 F1, 抽取类任务常用
- BLEU:机器翻译、文本生成
- ROUGE:摘要任务
- METEOR:兼顾词形、同义词,优于 BLEU
- Cosine Similarity: 回答向量与标准答案向量相似度. 可能向量相似事实错误
- MSE/L2距离
- LLM-as-Judge(工业界主流方案)
- 用强模型(GPT-5,Claude,本地强基座)充当裁判,输出打分,可设计维度:
- 事实准确性
- 逻辑连贯性
- 指令遵循度
- 有用性、简洁度
- 无幻觉、无不合规内容
- 输出形式: 1-5分/二元(合格/不合格)
- 用强模型(GPT-5,Claude,本地强基座)充当裁判,输出打分,可设计维度:
- 安全指标
- 幻觉率: 事实错误、无依据编造信息占比
- 指令遵循率: 是否严格遵守用户约束
- 拒答合规率: 对敏感、不合规问题正确拒绝回答比率
- 偏见、歧视、有害内容生成率
- 越狱成功率(Prompt Injection 攻击通过率)
- 工程性能指标
- TTFT, 首字延迟
- TPOT, token 生成速度
- 吞吐QPS
- 失败率, 失败/请求总数
- 超时率,
Agent 任务评估指标
- 任务结果指标
- 任务成功率 Task Success Rate 任务最终是否达成业务目标(二元指标)
- 任务完成完整度 部分完成可打 0~1 连续分数(多目标复杂任务)
- 结果正确性 最终输出答案是否符合事实需求
- Agent 决策链路指标
- 规划有效性
- 是否正确拆解复杂子任务
- 是否生成冗余、不可执行的步骤
- 工具调用准确率
- 选对工具比例
- 工具入参参数正确性
- 无效调用次数(重复调用、错误调用)
- 路径效率
- 完成任务所需轮次、工具调用次数
- 是否绕路、多余交互
- 反思/纠错能力
- 工具返回失败/错误信息后,能否修正策略,而非直接输出错误答案
- 记忆利用有效性
- 能否复用历史对话、历史工具结果,避免重复查询
- 规划有效性
- 交互与收敛指标
- 平均轮次:完成任务平均交互步数
- 提前终止率:陷入死循环、无限重试的比例
- 收敛率:多次尝试后能否逐步修正至正确方案
- 鲁棒性指标
- 干扰信息下抗干扰能力
- 工具返回异常、空数据、报错时容错能力
评估流水线
评估资产数据层
所有评估的数据准备,统一管理,持续迭代。
- 通用评测集:MMLU、GSM8K、HumanEval等标准学术基准
- 领域评测集:自建业务标注数据集(问答、抽取、文案、推理)
- Agent专属评测集:工具调用样本、多轮任务样本、异常场景样本(空数据、报错、歧义输入)
- 线上回流样本:线上失败case、人工差评case、疑难样本持续入库
离线自动化评测层
模型训练、微调、Prompt优化、Agent逻辑更新后,强制跑全量离线评测
1. LLM离线评测流程
批量输入测试样本 → 模型推理生成结果 → 自动指标计算(EM/F1/ROUGE) → LLM-as-Judge打分(6大维度)→ 采集LLM工程指标
2. Agent离线评测流程
加载Agent任务样本 → 模拟器环境执行(复现完整thought/action/observation轨迹) → 采集工具调用、轮次、纠错数据、工程指标
3. 输出结果
能力得分、退化指标、短板维度、不合格case清单
灰度抽样评测层
离线达标后,进入小流量灰度验证,规避离线与线上场景偏差
- 自动抽样评测:抽取5%-10%线上真实流量,自动打分核验
- 人工抽检复核:重点抽检Agent工具调用、复杂推理、高风险问答
- 合规风险复检:检测幻觉、越狱、违规内容
核心作用:解决离线评测“过拟合、不贴合真实业务”的问题。
线上持续监控层
全量上线后,7*24小时持续监控模型与Agent状态
监控指标
- 能力监控:实时任务成功率、幻觉率、工具调用错误率
- 工程监控:延迟、QPS、超时率、显存占用
- 数据漂移监控:输入分布变化、效果衰减监控
- 风险监控:违规内容生成率、越狱攻击成功率
闭环动作
效果衰减/指标异常 → 自动告警 → 坏case回流评测集 → 重新微调优化 → 再次评测上线
- 0
- 0
-
分享