III 版 ◆ 评测工程 ◆ Evaluation Engineering
第 III 版 5 章 约 146 分钟 建议顺序 第 3 位
III · 评测工程
Evaluation Engineering — 从许愿到工程
本版导读 · Why this section
没有评测的 Agent 迭代本质上是在许愿。这一部分讲清楚怎么建评测集、怎么定义指标口径、怎么让机器打分可信、以及如何把线上 badcase 变成回归门禁。评测是工程与研究的交界地带,也是最能体现系统性思维的地方。
目录 · In this section
01 入门
评测的第一性问题
How Do You Know It Got Better
"感觉这次好多了"不是工程结论。这一章讲清评测要回答的三个问题:好在哪个维度、好了多少、这个差异是真的还是噪声。
未读 24 分钟
02 进阶
评测集建设与防过拟合
Building the Set
评测集从哪来?答案是从线上长出来。这一章讲分层设计(冒烟 / 回归 / 边界 / 对抗)、保留集机制,以及怎么避免你的系统把评测集背下来。
未读 30 分钟
03 进阶
办事型 Agent 的硬指标
Executable Metrics
可执行率、参数准确率、任务完成率——听起来都对,但分母是什么?枚举和自由文本能用同一个口径吗?口径不清的指标等于没有指标。
未读 30 分钟
04 深入
洞察型评分与 LLM-as-Judge
Judging Insight
"洞察好不好"也能评吗?能,但要先把维度拆开:方向相关性、证据充分性、可操作性、表达清晰度。以及一个必须警惕的东西——机器打分的四类偏差。
未读 34 分钟
05 进阶
Trace、Replay 与线上闭环
Closing the Loop
出了问题查不到原因,是因为没有 trace;改了一版不敢上线,是因为没有 replay。这一章把"线上 badcase → 评测集 → 回归门禁 → 灰度"的闭环接起来。
未读 28 分钟
其他版块 · Other sections
- I 版 · Model Foundations 大模型原理 —— 先看懂发动机(5 章)
- II 版 · Harness Engineering Harness 工程 —— 模型之外的一切(8 章)
- IV 版 · Knowledge Engine 知识引擎 —— 让回答有据可查(4 章)