Harness Times
HARNESS 与 AGENT 工程学习站
原理 ◆ 工程 ◆ 评测 ◆ 知识
从这里开始 · Start Here
Model + Harness = Agent
模型之外的所有工作,都属于 Harness。这个学习站把那些工作拆成 4 个版块、22 章,从注意力机制一直讲到回归门禁——每一章都有原理图解、可运行的代码,以及面试官真正会追问的那几个问题。
如果你正在准备 Agent 方向的面试,大概率已经见过这句话。它出自一份真实招聘需求里对 Harness 团队的定义:「我们正在把前沿模型能力转化为领先的 Agent 产品,这其中除模型本身以外的所有工作,都属于 Harness 的范畴。」
这句话看起来像一句口号,实际划出的是一块极大的地。它包含执行链路、工具契约、上下文预算、记忆系统、多智能体编排、权限与沙箱、长任务可靠性,以及一整套让改动可以安全上线的评测与回滚机制。
其中绝大多数问题都不是模型问题,而是系统问题。模型没坏,是系统没兜住——这正是本站想讲清楚的事。
全部内容按「由浅入深」排列。每章结构固定:导读 → 原理正文 → SVG 图解 → 动手实操 → 面试问答 → 自测题。 学习进度、笔记与复习计划都保存在你自己的浏览器里,不上传任何数据。
本站速览
- 版块 4 个:大模型原理 / Harness 工程 / 评测工程 / 知识引擎
- 正文章节 22 章,约 11 小时连续阅读量
- 面试问答 72 组,含追问链与加分点
- 进度保存 浏览器本地,可导出 JSON 备份与恢复
建议读法
想尽快上手:直接读 II 版 Harness 工程,遇到原理卡点再回 I 版查。
准备面试:按 I → II → III → IV 顺序,每章读完把「面试官会怎么问」全部口头答一遍。
已经在做:跳到 III 评测工程与 IV 知识引擎,这两块是多数团队最薄弱的地方。
4 知识版块
22 正文章节
72 面试问答
0% 你的完成度
四大版块 · Sections
第 I 版 5 章 · 122 分钟
大模型原理
Model Foundations
Harness 的所有工程决策最终都落在模型的物理特性上:注意力是 O(n²) 的,缓存是按前缀命中的,激活是稀疏的,输出是采样的。不理解这四件事,就只能靠感觉调参数。这一部分只讲与工程强相关的原理,不推导公式。
未开始 先看懂发动机
第 II 版 8 章 · 258 分钟
Harness 工程
Harness Engineering
如果 Agent = Model + Harness,那么 Harness 就是"除模型本身以外的所有工作"。这是整个网站的主战场:循环、工具、上下文、记忆、编排、沙箱、长任务可靠性。每一章都按"原理 → 图解 → 代码 → 面试问答"展开。
未开始 模型之外的一切
第 III 版 5 章 · 146 分钟
评测工程
Evaluation Engineering
没有评测的 Agent 迭代本质上是在许愿。这一部分讲清楚怎么建评测集、怎么定义指标口径、怎么让机器打分可信、以及如何把线上 badcase 变成回归门禁。评测是工程与研究的交界地带,也是最能体现系统性思维的地方。
未开始 从许愿到工程
第 IV 版 4 章 · 124 分钟
知识引擎
Knowledge Engine
Agent 的幻觉不是靠提示词治好的,是靠"回答必须落在可验证的知识上"治好的。这一部分讲知识建模(实体 / 事实 / 推断三层)、RAG 的完整链路与失效模式、向量检索的原理与边界,以及如何让每一条引用都能被点开验证。
未开始 让回答有据可查
全部章节 · All chapters
01 入门
Transformer 与自注意力
Attention Is All You Need
Agent 的一切都跑在注意力机制之上。这一章只做一件事:让你能白板画出 QKV 到注意力矩阵的形状变化,并说清复杂度里的那个 n² 从哪来。
未读 22 分钟
02 进阶
KV Cache:多轮对话的隐性账单
The Hidden Bill of Multi-turn
Agent 的成本大头不在输入,而在每一轮都要重新送一遍的历史。KV Cache 把重复计算变成缓存命中,而命中率取决于一个你从没注意过的细节:前缀稳定性。
未读 26 分钟
03 进阶
MoE 与稀疏激活
Sparse Activation
总参数 671B 的模型为什么能比 70B 的稠密模型还便宜?答案在"激活参数量"和"总参数量"之间的那条缝里。这一章讲清 MoE 的收益、代价,以及面试里最容易答错的那道题。
未读 24 分钟
04 入门
采样、温度与确定性
Sampling and Determinism
同一个问题问两次得到不同答案,这不是 bug,是解码策略的必然结果。但在 Agent 里,不确定性会直接变成"工具参数写错了"。这一章讲清每个采样参数到底在动什么。
未读 20 分钟
05 深入
推理优化与成本杠杆
Inference Optimization
量化、PagedAttention、投机解码、连续批处理——四把把成本打下来的锤子。重点不是背名词,而是知道每个手段针对哪个瓶颈、代价是什么。
未读 30 分钟
01 入门
Harness 是什么
Model + Harness = Agent
"除模型本身以外的所有工作,都属于 Harness 的范畴"——这句话划出的地到底有多大?这一章给出一张完整的 Harness 能力地图,后面七章都挂在这张图上。
未读 24 分钟
02 入门
Agent Loop 与终止条件
The Loop and When to Stop
写一个循环谁都会,难的是知道什么时候让它停下来。任务完成、轮数用尽、预算耗尽、无进展、需要人工——五类终止条件缺一不可。
未读 32 分钟
03 进阶
Tool Use 与工具契约
Tools as Contracts
工具不是给人看的 API 文档,而是给模型看的能力契约。描述怎么写、错误怎么回喂、参数怎么校验、MCP 什么时候该用——这一章把工具层讲透。
未读 34 分钟
04 进阶
Context Engineering
What the Model Gets to See
Prompt Engineering 是"怎么说",Context Engineering 是"给它看什么"。上下文预算怎么分、什么常驻什么按需、顺序为什么会影响成本——这一章是效果上限的真正决定因素。
未读 36 分钟
05 进阶
Memory 记忆系统
Remember and Forget
记住什么是能力,忘掉什么才是设计。记忆的写入时机、冲突处理、可解释性与可删除性,决定了它到底是资产还是污染源。
未读 30 分钟
06 深入
Subagent 与多智能体编排
Orchestration
什么时候该多开一个 Agent,什么时候那是自找麻烦?答案是三个词:上下文隔离、并行提速、权限隔离。这一章给出选型标准与常见踩坑。
未读 34 分钟
07 深入
沙箱、权限与提示注入
Sandbox and Trust Boundary
把能力交出去之后,怎么守住边界?外部内容一律视为不可信数据、能力最小化、副作用操作强制确认、全量审计——四层防御缺一层都不够。
未读 32 分钟
08 进阶
长任务与失败恢复
Long-Horizon Reliability
跑着跑着模型不吐字了、上下文满了、进程被关了——这些才是 Harness 工程师每天面对的东西,也是"工程问题"与"研究问题"的分水岭。
未读 36 分钟
01 入门
评测的第一性问题
How Do You Know It Got Better
"感觉这次好多了"不是工程结论。这一章讲清评测要回答的三个问题:好在哪个维度、好了多少、这个差异是真的还是噪声。
未读 24 分钟
02 进阶
评测集建设与防过拟合
Building the Set
评测集从哪来?答案是从线上长出来。这一章讲分层设计(冒烟 / 回归 / 边界 / 对抗)、保留集机制,以及怎么避免你的系统把评测集背下来。
未读 30 分钟
03 进阶
办事型 Agent 的硬指标
Executable Metrics
可执行率、参数准确率、任务完成率——听起来都对,但分母是什么?枚举和自由文本能用同一个口径吗?口径不清的指标等于没有指标。
未读 30 分钟
04 深入
洞察型评分与 LLM-as-Judge
Judging Insight
"洞察好不好"也能评吗?能,但要先把维度拆开:方向相关性、证据充分性、可操作性、表达清晰度。以及一个必须警惕的东西——机器打分的四类偏差。
未读 34 分钟
05 进阶
Trace、Replay 与线上闭环
Closing the Loop
出了问题查不到原因,是因为没有 trace;改了一版不敢上线,是因为没有 replay。这一章把"线上 badcase → 评测集 → 回归门禁 → 灰度"的闭环接起来。
未读 28 分钟
01 进阶
知识建模:实体、事实、推断
Entity, Fact, Inference
把业务知识拆成三层——实体是可锚定的对象,事实是可溯源的关系,推断是带依据链的衍生结论。这一章讲清三层为什么必须分开,混在一起会出什么事。
未读 30 分钟
02 进阶
RAG 的链路与失效模式
Retrieval Augmented Generation
RAG 不是"检索 + 生成"两句话,它是一条有六个环节的链路,每个环节都能独立地把结果做错。这一章把失效模式逐个拆开,并给出定位手段。
未读 32 分钟
03 进阶
Embedding 与向量检索
Vectors and Similarity
语义检索为什么会找错?因为"语义相近"和"对回答问题有用"是两件事。这一章讲清向量检索的原理、相似度度量的选择,以及它的能力边界。
未读 28 分钟
04 深入
混合检索、Rerank 与知识可信
Hybrid Retrieval and Trust
召回要宽、排序要准、引用要能被点开验证。这一章把关键词检索与向量检索拼成一条混合链路,用 Rerank 做精排,最后解决"凭什么相信这条知识"的问题。
未读 34 分钟
关于进度与数据
所有学习记录——已学完章节、停留时长、笔记、自测作答、掌握度自评、复习队列——都保存在 你自己浏览器的 localStorage 里,不会发送到任何服务器。换设备或清理浏览器数据前,请到 学习进度 页导出 JSON 备份,之后可以随时导入恢复。