TouchAll技术博客
TouchAll技术博客
技术博客,聚焦LLM 业务流编排、资源最大化利用等领域。分享行业解决方案、技术架构解析、客户实践案例与前沿趋势,助力企业通过设备网格释放业务潜力。收藏本博客,获取业务自动化与价值创造的专业洞见。
首页
DeepEval
#提示词工程
2
#AIDD
2
#大模型评估
4
#DeepEval
2
#Agent
2
#数据库设计
3
#prometheus
1
#可观测设计
1
#系统设计
10
#缓存
5
#svelte
5
#airflow
1
#浏览器缓存控制
1
#前端开发
4
#web
1
#kubernetes
4
#web3
1
#后端开发
2
#rust
14
#Halo
0
DeepEval - Dataset 数据集
在 DeepEval中数据集通常就是一系列的 goldens. golden包含llm测试case的所有前置条件。 所以 dataset 就是 golden 的管理器, 使用golden去完成测试用例编写。 初始化数据集 dataset = EvaluationDataset() 添加数据 一个D
架构设计
Agent系统设计
DeepEval
大模型评估
14
0
0
2026-08-12
DeepEval - 快速上手
什么是 DeepEval? DeepEval 是开源 Python LLM 评测框架(github: confident-ai/deepeval),定位:LLM 应用的单元测试框架。 核心思想:用 LLM-as-a-Judge + 传统 NLP 指标,自动化评估 AI 输出质量,嵌入开发、CI/CD
企业业务自动化实施
Agent
DeepEval
大模型评估
12
0
0
2026-07-27