I 版 ◆ 大模型原理 ◆ Model Foundations
第 I 版 5 章 约 122 分钟 建议顺序 第 1 位
I · 大模型原理
Model Foundations — 先看懂发动机
本版导读 · Why this section
Harness 的所有工程决策最终都落在模型的物理特性上:注意力是 O(n²) 的,缓存是按前缀命中的,激活是稀疏的,输出是采样的。不理解这四件事,就只能靠感觉调参数。这一部分只讲与工程强相关的原理,不推导公式。
目录 · In this section
01 入门
Transformer 与自注意力
Attention Is All You Need
Agent 的一切都跑在注意力机制之上。这一章只做一件事:让你能白板画出 QKV 到注意力矩阵的形状变化,并说清复杂度里的那个 n² 从哪来。
未读 22 分钟
02 进阶
KV Cache:多轮对话的隐性账单
The Hidden Bill of Multi-turn
Agent 的成本大头不在输入,而在每一轮都要重新送一遍的历史。KV Cache 把重复计算变成缓存命中,而命中率取决于一个你从没注意过的细节:前缀稳定性。
未读 26 分钟
03 进阶
MoE 与稀疏激活
Sparse Activation
总参数 671B 的模型为什么能比 70B 的稠密模型还便宜?答案在"激活参数量"和"总参数量"之间的那条缝里。这一章讲清 MoE 的收益、代价,以及面试里最容易答错的那道题。
未读 24 分钟
04 入门
采样、温度与确定性
Sampling and Determinism
同一个问题问两次得到不同答案,这不是 bug,是解码策略的必然结果。但在 Agent 里,不确定性会直接变成"工具参数写错了"。这一章讲清每个采样参数到底在动什么。
未读 20 分钟
05 深入
推理优化与成本杠杆
Inference Optimization
量化、PagedAttention、投机解码、连续批处理——四把把成本打下来的锤子。重点不是背名词,而是知道每个手段针对哪个瓶颈、代价是什么。
未读 30 分钟
其他版块 · Other sections
- II 版 · Harness Engineering Harness 工程 —— 模型之外的一切(8 章)
- III 版 · Evaluation Engineering 评测工程 —— 从许愿到工程(5 章)
- IV 版 · Knowledge Engine 知识引擎 —— 让回答有据可查(4 章)