跳到主要内容

模型的解剖 — 一句话进去,到底发生了什么

这一章讲三件事: 一条文本进入模型后的完整流水线(切词→变数→互相参照→长度上限); 为什么各家模型换成了同一个新底座 Transformer(2017 年登场、如今几乎所有大模型共用的架构); 以及 MoE(把一个大模型拆成多个分工的「专家」小网络)新开的泄漏通道。 为什么拆解隐私的书要先讲解剖: 你得先知道数据藏在模型的哪些器官里,才谈得上保护它。

1. 先看现象:同一个问题,换个问法答案就变

你问模型「总结这份报告」,它答得很好;你把同一份报告拆成两半再喂,它答得更好或更差。 这不是玄学——模型对「一段文字怎么被切碎、怎么被摆进来」极其敏感。 而每一种切碎和摆放的方式,都是一个可能泄漏数据的位置。

作者在原书里给每个基础概念都配了一个「隐私与安全考量」小框, 本章就把这条流水线从头走到尾,每个器官停一站。

2. 顶层全景:四道工序

"The patient has a fever"
│ ① 分词:切成小片段

["The"," patient"," has"," a"," fe","ver"] ← 切法由各家的分词器决定
│ ② 嵌入:每个片段变成一串数

[0.21,-1.3,…] [0.8,0.02,…] … ← 意思相近的词,数也相近
│ ③ 注意力:每个位置互相看、按相关性取材

"fever" 的表示里掺进了 "patient" 的信息
│ ④ 全程受一个硬约束

上下文窗口:一次最多能看多少个标记(512 ~ 100 万,见第 4 节)

图说:四道工序,每道都留有数据痕迹。本章主走查就是这四个箭头。

3. 第①②站:切词与变成一串数

先补一块地基:神经网络

模型的本体是神经网络:一堆按层排开的简单零件,每个零件做的事都一样—— 把输入加权求和,再把结果传给下一层。

零件之间还夹着一个弯折的小开关,术语叫激活函数(没有这一下,模型只会画直线)。

调层与层之间的权重(那些可调的数),网络就学会把输入对应到想要的输出1

从旧当家到新当家:RNN 的退场

在 Transformer 之前,处理文字的当家网络是 RNN(循环网络):一次只喂一小片文字(术语叫标记), 内部状态像一条流水账一样把前文记下去。它的死穴是梯度消失 ——训练信号往回传时越传越弱,远处的依赖学不到,后来的 LSTM 用「门」部分缓解了它2。 但 RNN 一家还有个更致命的工程问题:必须一步接一步算,无法并行(多步同时算)3

也喂不饱 GPU(图形处理器,模型训练的主力硬件)。这就是被 Transformer 取代的原因,第 4 节细说。

走查第①站:分词(切成小片段)

拿我们的句子走第一步。分词(把文本切成小片段的工序)把文本切成小片段,每个片段叫一个标记(token):

可以是整词、词的碎片、或单个字符4。常见切法有按词切、按子词(词的碎片)切(如 BPE 这类 「高频搭配合并成一块」的算法)、按字符切。

各家模型各用各的——OpenAI 用 Tiktoken, Llama 用 SentencePiece,BERT(谷歌的老牌模型)用 WordPiece5

隐私观察点(书里的原话):分词可能无意间泄漏敏感信息, 所以书建议先做匿名化或去标识(把人名、证件号这类信息替换掉)再分词6。 这一步的完整工具在第 08 章。

还有一个更隐蔽的:比词更大的「组块」分析(把词组成名词短语等)有自己的风险—— 书里特别指出,某个切分方式可能是差分隐私的(一种可用数学度量的隐私保证,第 04 章讲), 换一种分辨率的切分却可能触发隐私违规7。切分粒度本身就是隐私参数。

走查第②站:嵌入

每个标记变成很长的一串数,这就是嵌入(embedding)——意思被装进了一串坐标里。 嵌入空间的妙处:意思相近的词,在空间里也挨得近——书里的例子是 "king" 离 "queen" 比 "car" 近, 甚至能做算术:king − man + woman ≈ queen8

隐私观察点:嵌入不是中立坐标。训练数据里的偏见会随嵌入传给下游模型; 发布自己训的嵌入可能反推训练数据;预训练——拿公开文本先教好的——嵌入本身可被「模型提取攻击」利用 (对手用它推断训练数据、甚至重建模型的一部分)9

4. 第③④站:注意力(每个位置互相看、按相关性取材)与上下文窗口

走查第③站:注意力

注意力机制让句子里每个位置去「看」其他位置,按相关程度取材。 自注意力(自己看自己这句话内部)的算法:拿当前位置的查询(一串数,行话叫向量), 跟所有位置的键(同样是一串数)算匹配分,按分数加权取材10

多头注意力——把这套打分取材并排做好几遍,每一「头」看不同侧面——让模型同时抓住多种关系。它对隐私研究的意义是双向的: 一方面注意力权重给了模型一点可解释性(能看到模型在强调什么,有助于发现安全问题)11; 另一方面注意力权重本身可被对抗攻击操纵来误导预测或套取信息12

为什么换 Transformer:平方代价

Transformer(2017 年那篇 "Attention Is All You Need" 带来的架构,分两个车间:管读入的车间叫编码器,管写出的负责把内部表示一步步变回文字,全靠注意力取代循环)13甩掉了「一步一步算」的包袱,但付出一个固定代价: 自注意力的计算量和内存随序列长度平方增长——句子长 10 倍,算的是 100 倍14。 平方增长逼出了「上下文窗口」这个硬约束(模型一次最多能处理的标记数)。

走查第④站:上下文窗口,一排具体数字

窗口数字最能说明代际差距,也最能说明隐私含义15:

模型上下文窗口相当于
原版 BERT512 个标记约一篇短文
GPT-32,048 个标记约几页纸
GPT-4 Turbo128,000 个标记一本中篇小说
Claude 3200,000 个标记更长
Gemini 1.5 Pro1,000,000 个标记整本书或整个代码库

窗口越长,三个风险越大(书里的原话概括):模型更容易记住并复述训练数据里的长段落; 恶意指令可以藏在长输入的深处(第 10 章的「语境误导」攻击靠的就是这个)。

多来源的信息在长窗口里被拼起来,可能拼出能识别个人的模式16。 书里给的缓解手段里有一条直接是隐私技术:对切出的块先做差分隐私再汇总17。 拉长窗口的工程手段(只算部分位置对的注意力、滑窗、环形注意力)书里列了,但没有改变计算量随长度平方增长的本质—— 只是让窗口塞得更多,隐私暴露面反而变大。

5. MoE:把模型拆成专家之后

把一个大模型拆成多个分工「专家」小网络的架构,行话叫混合专家(MoE),是近年大模型的另一条路线。

普通模型——参数全部参与每次计算,行话叫稠密模型——每个标记都要动用全部参数。

MoE 用一个门控(gating:给输入挑处理者的小路由器)网络把每个标记只送往少数几个 「专家」子网络,代表是 GPT-4、Mixtral、DeepSeek-R1、Qwen 系列18。 好处是省算力:用小模型的开销,摸到大模型的性能。

但对隐私研究来说,MoE 新开了三条泄漏通道(书里逐条列了)19:

  1. 敏感信息可能在特定专家里富集——专家各学各的数据子集,秘密可能集中存在某个专家里,定向提取它就行;
  2. 「哪些专家被激活」本身是侧信道——激活模式能反推输入的性质、甚至训练数据的构成;
  3. 门控可被操纵——攻击者诱导路由,把输入送往更脆弱或存有敏感信息的专家,还能探查模型的专业分工。

判断(我们的,不是书里的): 这三条通道里第二条最被低估。 传统安全审计只看「模型输出了什么」,而 MoE 的激活模式是输出之前的信息; 要观测它,攻击者需要的只是部署侧的一次信息泄漏。书的处理是点到为止, 没有给出「激活模式泄漏」的实测案例,把它当作研究方向而非已知漏洞更稳妥。 如果错,会错在: 如果未来证明激活模式在黑盒 API 下完全观测不到, 那这条风险就只对开源——代码公开——部署成立,严重性要降级。

6. 作者的判断与证据

书里给了机制的:四道工序全部是教科书内容,证据充分; 上下文窗口的五个数字有公开出处,可直接核对。

书里点到、证据在后面的:分词泄漏、注意力被操纵、MoE 三通道—— 原书在每节末尾写「我们将在后面的章节讨论」。到全书结束回头看, MoE 的三条通道是提出问题但全书没再回来验证的部分,这是本书的一个结构缺口。

7. 边界与局限

  • 本章是「够用」的解剖,不是完整的教科书:训练怎么做、参数怎么更新,留到第 03 章;
  • 上下文窗口的数字是 2024–2025 年的快照,窗口竞赛仍在继续,具体数字会过时, 但「越长越危险」的机制不会;
  • MoE 的隐私分析停在分类层面,没有用数字做的实验;
  • 多模态(图像、视频的标记化)书里一句带过,展开的部分不在本书范围。

8. 可带走的

  1. 一句话进模型要过四道工序:分词→嵌入→注意力→(全程受)上下文窗口约束;
  2. 分词前先去标识:书明确建议,否则切词本身可能泄漏敏感信息;
  3. 切分粒度是隐私参数:这种切分是差分隐私的,换种分辨率可能就违规;
  4. 嵌入空间「意思即距离」,但偏见、训练数据痕迹也都在里面;
  5. 注意力给了一点可解释性,但权重可被对抗操纵,别把它当可信依据;
  6. 平方复杂度——计算量随长度平方增长——是窗口上限的根源;窗口从 512 涨到 100 万,隐私暴露面同步涨;
  7. MoE 省算力,但开了三条新通道:专家富集、激活侧信道、门控操纵;
  8. 审计模型时,别只看输出——「模型内部怎么走的」也是数据。

9. 原文地图

主题原书章原文位置
神经网络与 RNNBasic Building Blocks of Language Modelstext/06-fm-basic-building-blocks-of-language-models.txt:7(搜「artificial neural networks」)
梯度消失与 LSTMBasic Building Blocks of Language Modelstext/06-fm-basic-building-blocks-of-language-models.txt:49(搜「vanishing gradient」)
RNN 无法并行、喂不饱 GPUBasic Building Blocks of Language Modelstext/06-fm-basic-building-blocks-of-language-models.txt:67(搜「parallelize」)
分词定义与切法Key Concepts in LLMstext/07-fm-key-concepts-in-llms.txt:25(搜「smaller units called tokens」) · text/07-fm-key-concepts-in-llms.txt:41(搜「Tiktoken」)
分词的隐私提醒Key Concepts in LLMstext/07-fm-key-concepts-in-llms.txt:45(搜「leak sensitive information」)
切分分辨率的隐私Key Concepts in LLMstext/07-fm-key-concepts-in-llms.txt:67(搜「differential private」)
嵌入与 king/queenKey Concepts in LLMstext/07-fm-key-concepts-in-llms.txt:73(搜「dense vector representations」) · text/07-fm-key-concepts-in-llms.txt:75(搜「king」)
嵌入的提取攻击Key Concepts in LLMstext/07-fm-key-concepts-in-llms.txt:81(搜「model extraction」)
注意力与缩放点积Key Concepts in LLMstext/07-fm-key-concepts-in-llms.txt:95(搜「scaled dot product」)
注意力可解释与可攻击Key Concepts in LLMstext/07-fm-key-concepts-in-llms.txt:118(搜「interpretability」) · text/07-fm-key-concepts-in-llms.txt:120(搜「vulnerable」)
窗口数字 512→100 万Key Concepts in LLMstext/07-fm-key-concepts-in-llms.txt:126(搜「128,000 tokens」)
长窗口三风险Key Concepts in LLMstext/07-fm-key-concepts-in-llms.txt:146(搜「opportunities and risks」)
Transformer 与平方复杂度Transformer Architecturetext/08-fm-transformer-architecture.txt:3(搜「Attention Is All You Need」) · text/08-fm-transformer-architecture.txt:15(搜「quadratic complexity」)
MoE 与门控Mixture of Experts Architecturetext/09-fm-mixture-of-experts-architecture.txt:5(搜「gating network」)
MoE 三条隐私通道Mixture of Experts Architecturetext/09-fm-mixture-of-experts-architecture.txt:36(搜「concentrated in specific experts」) · text/09-fm-mixture-of-experts-architecture.txt:38(搜「side-channel」) · text/09-fm-mixture-of-experts-architecture.txt:40(搜「manipulate the gating」)

Footnotes

  1. 出处:「Basic Building Blocks of Language Models」第 7 段(text/06-fm-basic-building-blocks-of-language-models.txt:7,搜「artificial neural networks」)与第 9 段(搜「activation function」)。

  2. 出处:「Basic Building Blocks of Language Models」第 49 段(text/06-fm-basic-building-blocks-of-language-models.txt:49,搜「vanishing gradient」);LSTM 的三门结构见 :53(搜「input gate」)。

  3. 出处:「Basic Building Blocks of Language Models」第 67 段(text/06-fm-basic-building-blocks-of-language-models.txt:67,搜「parallelize computations across all time steps」)与第 69 段(搜「GPU」)。

  4. 出处:「Key Concepts in LLMs」第 25 段(text/07-fm-key-concepts-in-llms.txt:25,搜「smaller units called tokens」)。多模态模型的图像、视频同样被标记化,见同段。

  5. 出处:「Key Concepts in LLMs」第 35 段(text/07-fm-key-concepts-in-llms.txt:35,搜「Byte Pair Encoding」)与第 41 段(text/07-fm-key-concepts-in-llms.txt:41,搜「Tiktoken」)。

  6. 出处:「Key Concepts in LLMs」第 45 段(text/07-fm-key-concepts-in-llms.txt:45,搜「leak sensitive information」)。这是书里的 Note 框原话:「Consider applying data anonymization or de-identification techniques before tokenizing」。

  7. 出处:「Key Concepts in LLMs」第 67 段(text/07-fm-key-concepts-in-llms.txt:67,搜「differential private」)。原文:a chunking process might be differential private, but another chunking process of a different resolution might trigger a privacy violation。

  8. 出处:「Key Concepts in LLMs」第 73 段(text/07-fm-key-concepts-in-llms.txt:73,搜「dense vector representations」)与第 75 段(text/07-fm-key-concepts-in-llms.txt:75,搜「king」)。

  9. 出处:「Key Concepts in LLMs」第 81 段(text/07-fm-key-concepts-in-llms.txt:81,搜「model extraction」)。

  10. 出处:「Key Concepts in LLMs」第 95 段(text/07-fm-key-concepts-in-llms.txt:95,搜「scaled dot product」)。

  11. 出处:「Key Concepts in LLMs」第 118 段(text/07-fm-key-concepts-in-llms.txt:118,搜「interpretability」)。

  12. 出处:「Key Concepts in LLMs」第 120 段(text/07-fm-key-concepts-in-llms.txt:120,搜「vulnerable」)。

  13. 出处:「Transformer Architecture」第 3 段(text/08-fm-transformer-architecture.txt:3,搜「Attention Is All You Need」)。

  14. 出处:「Transformer Architecture」第 15 段(text/08-fm-transformer-architecture.txt:15,搜「quadratic complexity」)。

  15. 出处:「Key Concepts in LLMs」第 126 段(text/07-fm-key-concepts-in-llms.txt:126,搜「128,000 tokens」)。同段还有 BERT 512(约 380 个词)、GPT-3 2,048、Claude 3 200,000、Gemini 1.5 Pro 100 万。

  16. 出处:「Key Concepts in LLMs」第 146 段(text/07-fm-key-concepts-in-llms.txt:146,搜「opportunities and risks」)。

  17. 出处:「Key Concepts in LLMs」第 176 段(text/07-fm-key-concepts-in-llms.txt:176,搜「chunk level」)。

  18. 出处:「Mixture of Experts Architecture」第 3 段(text/09-fm-mixture-of-experts-architecture.txt:3,搜「Mixtral」)与第 5 段(text/09-fm-mixture-of-experts-architecture.txt:5,搜「gating network」)。

  19. 出处:「Mixture of Experts Architecture」第 36 段(text/09-fm-mixture-of-experts-architecture.txt:36,搜「concentrated in specific experts」)、第 38 段(text/09-fm-mixture-of-experts-architecture.txt:38,搜「side-channel」)、第 40 段(text/09-fm-mixture-of-experts-architecture.txt:40,搜「manipulate the gating」)。