TouchAll技术博客
TouchAll技术博客
技术博客,聚焦LLM 业务流编排、资源最大化利用等领域。分享行业解决方案、技术架构解析、客户实践案例与前沿趋势,助力企业通过设备网格释放业务潜力。收藏本博客,获取业务自动化与价值创造的专业洞见。
首页
Agent
#提示词工程
2
#AIDD
2
#大模型评估
4
#DeepEval
2
#Agent
2
#数据库设计
3
#prometheus
1
#可观测设计
1
#系统设计
10
#缓存
5
#svelte
5
#airflow
1
#浏览器缓存控制
1
#前端开发
4
#web
1
#kubernetes
4
#web3
1
#后端开发
2
#rust
14
#Halo
0
DeepEval - 快速上手
什么是 DeepEval? DeepEval 是开源 Python LLM 评测框架(github: confident-ai/deepeval),定位:LLM 应用的单元测试框架。 核心思想:用 LLM-as-a-Judge + 传统 NLP 指标,自动化评估 AI 输出质量,嵌入开发、CI/CD
企业业务自动化实施
Agent
DeepEval
大模型评估
10
0
0
2026-07-27
[系统设计 - Agent系统设计专题] 1. Agent工程评估体系
建立评估体系的目的 保证迭代优化效果 客观衡量模型能力水平:使用可量化的标准,客观衡量模型在各种任务优劣 通过评估体系验证改动是否有效,防止更新模型对Agent工程后能力退化 匹配真实业务需求 适配业务任务,通用基准无法代表行业场景,自建业务测评集,校验模型能够胜任 作为决策依据,不再依靠厂商宣传或
架构设计
Agent系统设计
Agent
系统设计
10
0
0
2026-07-23