TouchAll技术博客
TouchAll技术博客
技术博客,聚焦LLM 业务流编排、资源最大化利用等领域。分享行业解决方案、技术架构解析、客户实践案例与前沿趋势,助力企业通过设备网格释放业务潜力。收藏本博客,获取业务自动化与价值创造的专业洞见。
首页
大模型评估
#提示词工程
2
#AIDD
2
#大模型评估
4
#DeepEval
2
#Agent
2
#数据库设计
3
#prometheus
1
#可观测设计
1
#系统设计
10
#缓存
5
#svelte
5
#airflow
1
#浏览器缓存控制
1
#前端开发
4
#web
1
#kubernetes
4
#web3
1
#后端开发
2
#rust
14
#Halo
0
DeepEval - Dataset 数据集
在 DeepEval中数据集通常就是一系列的 goldens. golden包含llm测试case的所有前置条件。 所以 dataset 就是 golden 的管理器, 使用golden去完成测试用例编写。 初始化数据集 dataset = EvaluationDataset() 添加数据 一个D
架构设计
Agent系统设计
DeepEval
大模型评估
14
0
0
2026-08-12
提示词工程 - 认识 Temperature 温度
首先 Temperature 代表大模型输出的随机性参数, 本章将用实验认识 Temperature 温度如何控制输出质量,为我们的目标任务设置使用合适的 temperature 区间,引导大模型达到我们的预期目标。 整体思路 核心目标:用标准化数据集 + 量化指标 + 对照实验,量化三组参数对「幻
企业业务自动化实施
架构设计
Agent系统设计
提示词工程
大模型评估
系统设计
11
0
0
2026-08-06
[系统设计 - Agent 体系设计] 提示词工程 - 新手入门
提示词工程(Prompt Engineering)是一套规范化设计、调试、优化输入文本,用来精准控制大模型输出格式、逻辑、风格、能力边界的方法论,核心目标:降低模型幻觉、稳定输出、复用模板、挖掘模型极限能力。 整体分为基础理论、核心编写技巧、高阶范式、工程落地、调优运维、行业落地六大板块。 一、核心
架构设计
企业业务自动化实施
Agent系统设计
大模型评估
提示词工程
15
0
0
2026-08-06
DeepEval - 快速上手
什么是 DeepEval? DeepEval 是开源 Python LLM 评测框架(github: confident-ai/deepeval),定位:LLM 应用的单元测试框架。 核心思想:用 LLM-as-a-Judge + 传统 NLP 指标,自动化评估 AI 输出质量,嵌入开发、CI/CD
企业业务自动化实施
Agent
DeepEval
大模型评估
12
0
0
2026-07-27