TouchAll技术博客

TouchAll技术博客

Agent

DeepEval - 快速上手

什么是 DeepEval? DeepEval 是开源 Python LLM 评测框架(github: confident-ai/deepeval),定位:LLM 应用的单元测试框架。 核心思想:用 LLM-as-a-Judge + 传统 NLP 指标,自动化评估 AI 输出质量,嵌入开发、CI/CD

[系统设计 - Agent系统设计专题] 1. Agent工程评估体系

建立评估体系的目的 保证迭代优化效果 客观衡量模型能力水平:使用可量化的标准,客观衡量模型在各种任务优劣 通过评估体系验证改动是否有效,防止更新模型对Agent工程后能力退化 匹配真实业务需求 适配业务任务,通用基准无法代表行业场景,自建业务测评集,校验模型能够胜任 作为决策依据,不再依靠厂商宣传或