从评估到监控:Snapshot 时序化、Workspace/Project、Cloud SDK、Guardrails 与 Prompt 优化
30 秒导读: 前面四章讲的是「怎么算出一份评估结果」(descriptor / metric / judge / stattest)。 本章讲算完之后:一份
Snapshot怎么被存进Project、沿时间轴堆成趋势图(监控 UI);怎么 把本地的 prompt / config / dataset 同步到 Evidently Cloud(SDK);怎么在请求发生的那一刻用 Guardrails 同步拦截有害输出;以及怎么用PromptOptimizer拿带标注的数据集反复打磨 prompt。 一句话:从「跑一次评估」变成「持续可观测 + 运行时护栏 + prompt 运维」。
本章不重复讲评估怎么算——那在 01/02/03/04。 这里只讲评估结果如何被沉淀、可视化、跨时间监控,以及运行时护栏和 prompt 运维工具。
1. 这是什么(零基础也能懂)
一句话定义: 这是 Evidently 的运维面——把评估从"在 notebook 里跑一次、看一眼报告"升级成 "持续跑、存起来、在 dashboard 上盯趋势,并在线上实时拦截坏输出"。
解决什么问题 / 给谁用: 假设你上线了一个 LLM 客服。你已经会用 Evidently 算"这批回答里有多少条 有毒 / 跑题 / 幻觉"(第 02-03 章)。但线上是天天在变的:
- 你想看这周和上周比,有毒率是涨了还是跌了 → 需要把每天的评估结果按时间轴排起来 → 监控 UI。
- 你不想等离线批量跑完才发现问题,想在回答发给用户之前就挡住有毒内容 → Guardrails。
- 你的判官 prompt 老是判错,你手里有 200 条人工标注,想让它自己学着改好 → Prompt 优化。
- 你没有真实评测集,想用文档合成一批 RAG 问答对来打分 → datagen。
它能做什么(功能一览):
| 能力 | 干什么 | 本章小节 |
|---|---|---|
| Workspace / Project | 把一批 Snapshot 归档到项目里,起一个本地 dashboard 服务 | §3 |
| ProjectDashboard | 配 tab / panel,让同一指标沿时间轴堆成趋势图 | §3、§4 |
| Cloud SDK | 用 RemoteWorkspace 把 prompt / config / dataset 同步到云端 | §5 |
| Guardrails | 在请求时同步校验输入/输出,不合格就抛异常拦下 | §6 |
| PromptOptimizer | 拿带标注数据集迭代改判官/任务 prompt | §7 |
| datagen | 用文档合成 RAG 评测数据 | §7 末 |
一句话直觉/类比: 把评估比作"体检"