LLM 即评委:判官 Descriptor、Prompt 模板与异步批量 LLM 引擎
30 秒导读: 有些质量问题没有现成公式——"这段回答礼貌吗?""检索到的上下文和问题相关吗?"。 Evidently 的做法是再请一个 LLM 当评委(LLM-as-a-judge):给它一段说明和评分标准,让它给 每一行输出打个类别 / 分数 / 理由。本章讲清这条链路的三层:判官 Descriptor(把数据喂进去)、 Prompt 模板(声明式拼出判官提示词)、异步批量 LLM 引擎(并发跑、按 token 限流、多 provider 适配)。
本章是 Evidently 系列的第 3 章。它只讲评估计算本身(怎么用 LLM 算出分数)。上下游请看:
- Descriptor 基类、行级评估怎么把分数长到数据上 → 01-data-model.md
- 算出来的列怎么被 Metric 聚合成 Report → 02-metrics-engine.md
- guardrails 运行时拦截、prompt 自动优化(
llm/optimization)这些运维面 → 05-observability-and-ops.md