TouchAll技术博客

TouchAll技术博客

[系统设计 - Agent系统设计专题] 1. Agent工程评估体系

建立评估体系的目的

  1. 保证迭代优化效果
    1. 客观衡量模型能力水平:使用可量化的标准,客观衡量模型在各种任务优劣
    2. 通过评估体系验证改动是否有效,防止更新模型对Agent工程后能力退化
  2. 匹配真实业务需求
    1. 适配业务任务,通用基准无法代表行业场景,自建业务测评集,校验模型能够胜任
    2. 作为决策依据,不再依靠厂商宣传或少量样例测试
    3. 规定上线准入标准
  3. 保障合规与安全
    1. 识别隐形风险,检测幻觉、偏见、歧视、隐私泄露、违规内容生成等安全问题
    2. 满足合规要求
  4. 工程成本管控
    1. 性能与成本权衡,评估吞吐、延迟、显存占用、推理成本,横向对比找到效果达标下成本最优的方案
    2. 定位瓶颈,是模型能力不足、提示词问题、 上下文工程缺陷还是Agent架构问题
  5. 建立统一评价共识
    1. 统一团队内评判标准,消除研发、产品、业务人员 “各说各话” 的认知分歧;形成可沉淀的评测资产、评测流程,建立标准化 AI 研发流程。

如何建立评估指标

基础大模型原生评估指标

  1. 传统 NLP 指标(适合有标准答案场景,不适合开放问答、推理场景)
    1. Exact Match: 输出和标准答案完全匹配
    2. F1 Score: 字符/token 重叠 F1, 抽取类任务常用
    3. BLEU:机器翻译、文本生成
    4. ROUGE:摘要任务
    5. METEOR:兼顾词形、同义词,优于 BLEU
    6. Cosine Similarity: 回答向量与标准答案向量相似度. 可能向量相似事实错误
    7. MSE/L2距离
  2. LLM-as-Judge(工业界主流方案)
    1. 用强模型(GPT-5,Claude,本地强基座)充当裁判,输出打分,可设计维度:
      1. 事实准确性
      2. 逻辑连贯性
      3. 指令遵循度
      4. 有用性、简洁度
      5. 无幻觉、无不合规内容
    2. 输出形式: 1-5分/二元(合格/不合格)
  3. 安全指标
    1. 幻觉率: 事实错误、无依据编造信息占比
    2. 指令遵循率: 是否严格遵守用户约束
    3. 拒答合规率: 对敏感、不合规问题正确拒绝回答比率
    4. 偏见、歧视、有害内容生成率
    5. 越狱成功率(Prompt Injection 攻击通过率)
  4. 工程性能指标
    1. TTFT, 首字延迟
    2. TPOT, token 生成速度
    3. 吞吐QPS
    4. 失败率, 失败/请求总数
    5. 超时率,

Agent 任务评估指标

  1. 任务结果指标
    1. 任务成功率 Task Success Rate 任务最终是否达成业务目标(二元指标)
    2. 任务完成完整度 部分完成可打 0~1 连续分数(多目标复杂任务)
    3. 结果正确性 最终输出答案是否符合事实需求
  2. Agent 决策链路指标
    1. 规划有效性
      • 是否正确拆解复杂子任务
      • 是否生成冗余、不可执行的步骤
    2. 工具调用准确率
      • 选对工具比例
      • 工具入参参数正确性
      • 无效调用次数(重复调用、错误调用)
    3. 路径效率
      • 完成任务所需轮次、工具调用次数
      • 是否绕路、多余交互
    4. 反思/纠错能力
      1. 工具返回失败/错误信息后,能否修正策略,而非直接输出错误答案
    5. 记忆利用有效性
      1. 能否复用历史对话、历史工具结果,避免重复查询
  3. 交互与收敛指标
    1. 平均轮次:完成任务平均交互步数
    2. 提前终止率:陷入死循环、无限重试的比例
    3. 收敛率:多次尝试后能否逐步修正至正确方案
  4. 鲁棒性指标
    1. 干扰信息下抗干扰能力
    2. 工具返回异常、空数据、报错时容错能力

评估流水线

评估资产数据层

所有评估的数据准备,统一管理,持续迭代。

  • 通用评测集:MMLU、GSM8K、HumanEval等标准学术基准
  • 领域评测集:自建业务标注数据集(问答、抽取、文案、推理)
  • Agent专属评测集:工具调用样本、多轮任务样本、异常场景样本(空数据、报错、歧义输入)
  • 线上回流样本:线上失败case、人工差评case、疑难样本持续入库

离线自动化评测层

模型训练、微调、Prompt优化、Agent逻辑更新后,强制跑全量离线评测

1. LLM离线评测流程

批量输入测试样本 → 模型推理生成结果 → 自动指标计算(EM/F1/ROUGE) → LLM-as-Judge打分(6大维度)→ 采集LLM工程指标

2. Agent离线评测流程

加载Agent任务样本 → 模拟器环境执行(复现完整thought/action/observation轨迹) → 采集工具调用、轮次、纠错数据、工程指标

3. 输出结果

能力得分、退化指标、短板维度、不合格case清单

灰度抽样评测层

离线达标后,进入小流量灰度验证,规避离线与线上场景偏差

  • 自动抽样评测:抽取5%-10%线上真实流量,自动打分核验
  • 人工抽检复核:重点抽检Agent工具调用、复杂推理、高风险问答
  • 合规风险复检:检测幻觉、越狱、违规内容

核心作用:解决离线评测“过拟合、不贴合真实业务”的问题。

线上持续监控层

全量上线后,7*24小时持续监控模型与Agent状态

监控指标

  • 能力监控:实时任务成功率、幻觉率、工具调用错误率
  • 工程监控:延迟、QPS、超时率、显存占用
  • 数据漂移监控:输入分布变化、效果衰减监控
  • 风险监控:违规内容生成率、越狱攻击成功率

闭环动作

效果衰减/指标异常 → 自动告警 → 坏case回流评测集 → 重新微调优化 → 再次评测上线