注意力的核心 — 打分、归一、加权混合,与 QKV 三个矩阵
这一章讲透一个机制: 注意力——大语言模型的心脏零件。 原书第 3 章是全书 最难也最长的一章,我们把它拆成两章: 本章讲「注意力本身怎么算」(从无到有,加上可学习的矩阵), 下一章讲「怎么把它改造成能用于生成」(遮未来、防背题、多开几路)。 读完本章,你能用纸笔把一句六个词的句子的注意力算完。
1. 这一章讲什么
第 01 章说过,Transformer 的关键零件是注意力:让模型处理一个词时有选择地「回头看」前文的词。 这一章回答三个问题:为什么需要它(老办法卡在哪)、它具体怎么算(三步,带真实数字)、 以及 GPT 在用的版本多了哪两样东西(三个学出来的矩阵、一次除以根号 d 的缩放)。
2. 顶层全景
输入:六个词,每个词是 3 个数(第 02 章的嵌入)
"Your journey starts with one step"
对每个词(以 journey 为例)做三 件事:
① 打分:journey 挨个和六个词算点积(相似度)
→ [0.95, 1.50, 1.48, 0.84, 0.71, 1.09]
② 归一:softmax 变成和为 1 的权重
→ [0.14, 0.24, 0.23, 0.12, 0.11, 0.16]
③ 混合:按权重把六个词的向量加在一起
→ journey 的新向量 = [0.4419, 0.6515, 0.5683]
(里面掺进了全句的信息,这叫「上下文向量」)
然后升级:每个词先进三个「学出来的投影」(查询 Q / 键 K / 值 V),
打分用 Q 和 K 算,混合用 V 混合——这就是 GPT 在用的版本。
图说:全程只有点积、softmax、加权求和三种运算,没有任何「智能」;
智能来自训练把那三个矩阵调对(第 06 章)。