评估:把表现变成可信的信号
这一章讲三件事: 测什么(组合体,不是裸模型)、怎么判(环境、 数据集、 指标、裁判)、测完敢不敢信(统计显著性)。最后用一道成本账回答老板的问题: 「跑一个 Agent 到底多少钱」。
1. 这一章讲什么
第 01 章把 Harness 的五个功能里,「验证」留给了本章。评估在 Harness 中扮演 「验证」功能的核心角色,而本章开头就纠正一个最常见的错位:评估的对象不是 模型,而是模型与 Harness 的组合体——同一模型在不同 Harness 里表现可以差出 悬殊。区分两类问题的手段是模型替换实验:固定 Harness 只换模型——换强模型 分数不涨,瓶颈在 Harness;分数随模型能力大幅波动,瓶颈才在模型。注意它与 消融实验的分工:消融定位 Harness 内部哪个部件重要,模型替换区分瓶颈在模型还是 Harness1。
2. 顶层全景
定义测试用例 → 搭环境(工具/初始状态) → 跑 Agent → 用 Rubric 评分 → 分析
│ │
└────── 评估结果 → 定位瓶颈(模型 or Harness)→ 改进 → 回到起点
图说:评估不是期末考试,是开发循环里的仪表盘。
分数只有能指导下一步动作,才有价值。
3. 核心原理
3.1 主走查:三轮退款对话的成本账
场景与全部数字来自原书;单价为原书示例设定。
问题:「跑一次 Agent 任务要多少钱?」直觉答案是「模型单价 × token 数」, 真实答案复杂得多——因为上下文会复利。书里用一轮退款任务算了完整的三轮账2:
第 1 轮 输入 2,500 token(系统提示词+任务),输出 150
第 2 轮 输入 3,200 token(第 1 轮全部 + 工具结果 + 新回复),输出 200
第 3 轮 输入 3,800 token(又长了一圈),输出 250
——每轮的输入都包含之前所有轮次:这就是复利
账单(含缓存):三轮合计 $0.022
完全无缓存: 三轮输入约 $0.029,加输出合计约 $0.036
三个放大因素把这笔小账变大:思考模式(每轮多生成 500-2,000 个思考 token, 成本可能翻 3-5 倍);工具结果反复计费(某轮一个 5,000 token 的网页, 之后每轮都要为它付钱);弯路(10 轮才完成,上下文累积 20,000+ token)。 所以书里的结论是:成本优化的核心不在选便宜的模型,而在控制轮次和上下文 增长——这恰好是第二至五章全部技术的经济动机3。