TouchAll技术博客

TouchAll技术博客

DeepEval

DeepEval - Dataset 数据集

在 DeepEval中数据集通常就是一系列的 goldens. golden包含llm测试case的所有前置条件。 所以 dataset 就是 golden 的管理器, 使用golden去完成测试用例编写。 初始化数据集 dataset = EvaluationDataset() 添加数据 一个D

DeepEval - 快速上手

什么是 DeepEval? DeepEval 是开源 Python LLM 评测框架(github: confident-ai/deepeval),定位:LLM 应用的单元测试框架。 核心思想:用 LLM-as-a-Judge + 传统 NLP 指标,自动化评估 AI 输出质量,嵌入开发、CI/CD