跳到主要内容

nndl-general 阅读笔记(供 06–27 章写作用)

用法:上下文紧了就读这份,不要重读原文。 每条带 text/xx.txt:N 行号与可搜短语。 01–05 章已写完的部分不记。行号为 2026-08-27 转码版,漂了按短语自愈。

原书第3章(text/04-ch03.txt)→ 拆解 06、07

  • 全连接困境:224×224×3≈15 万输入 × 1000 神经元 = 第一层 1.5 亿参数(:177,搜「1.5 亿个」);猫在左上角就傻眼,「陌生位置」(:182-185)
  • 局部连接:一个神经元只看 3×3×3=27 个输入(:197,搜「27 个输入」)
  • 权重共享→平移等变性:「位置变了,响应也跟着变」;配合汇聚才近似平移不变(:202-206,搜「平移等变性」)
  • 图3.4 卷积走查:5×5 图(上两行 0 下三行 1)配 3×3 水平边缘核(−1/0/+1 三行),红框九数 (0+0+0)+(0+0+0)+(1+1+1)=3;特征图上两行 3 最下行 0(:207-221,搜「红框圈出的输入块」、「(0+0+0)」)
  • 多卷积核各产一张特征图(:230-232);感受野「拿着放大镜看桌面上的一小块」→深层看整图(:233-238);浅层边缘深层眼睛轮子(:239-241)
  • 休伯尔与维泽尔 1959 猫视觉皮层,Gabor 条纹,1981 诺贝尔(:242-248,搜「大卫·休伯尔」)
  • 汇聚:最大汇聚 2×2 取最大;两作用=降分辨率+平移不变性;无可学参数;可让步长>1 卷积替代(:252-261)
  • 典型架构「卷积+激活+汇聚」反复堆,空间降通道升 = 由具体到抽象(:262-270)
  • AlexNet 2012:top-5 26.2%→15.3%(:276-279)
  • 里程碑(:296-324):LeNet 6 万参数(1989/1998)、AlexNet 8 层 6000 万、VGG 3×3 堆 16/19 层、GoogLeNet 6.7%、ResNet 152 层 3.6% 低于人类基线约 5%、DenseNet、EfficientNet、ViT(2020);「无数小改进的累积」(:322-324)
  • 残差连接:h(l+1)=h(l)+f(h(l)),梯度走近路,每层学「小的修正」;今天几乎所有深度网络都用(:287-290)
  • RNN:序列两特殊=长度不固定+长程依赖(:329-339);隐状态=短期记忆(:344);时间上共享权重,参数量与长度无关(:369-371)
  • 梯度消失/爆炸:特征值<1 指数衰减 >1 爆炸(:376-379);「我生在上海……(中间三百个字)……所以我的母语是」(:380-383)
  • LSTM(1997 Hochreiter & Schmidhuber,遗忘门 2000 Gers):细胞状态=信息高速公路,三道门(遗忘/输入/输出,Logistic 输出 0-1)(:384-392);GRU 两门(:393-394);2016 Google 神经机器翻译用多层 LSTM(:395-397)
  • 情感分类「东西挺好,就是快递太慢了」词袋分不清转折(:421-424)
  • RNN 历史地位:2018 后被 Transformer 取代;Mamba 等状态空间模型是思想回归,「历史往往不是直线」(:425-431)
  • 双向 RNN:「苹果刚发布了新手机」看后面才知是公司(:433-437)
  • Seq2Seq:编码器压成上下文向量→解码器展开;长句装不下;2014 Bahdanau 注意力=回头查原句(:438-446)
  • 三种结构分工:归纳偏置硬编码进连接方式;「理论上能学任何东西,实际上什么都学不好」(:492-509)

原书第4章(text/05-ch04.txt)→ 拆解 08、15(部分)

  • 1986 反向传播发表,再等二十多年(:32-36);低谷期「投稿带 neural network 字样会扣分」传闻(:45-48)
  • 三位坚持者:辛顿(CIFAR 1987 起资助)、杨立昆(LeNet)、本吉奥(2003 神经语言模型)(:51-61)
  • 2006 DBN 逐层预训练,「深度学习」名字重新成为旗帜(:63-73)
  • 2010 Xavier、2011 ReLU 用于深层(:79-83);2018 图灵奖、2024 辛顿诺贝尔物理+AlphaFold 化学(:93-99)
  • 训练三难:鞍点(高维里比局部最优常见,「骗人」梯度趋于零)(:113-137);梯度消失/爆炸 0.8³⁰≈0.001、1.2³⁰≈237(:142-146,搜「指数级缩小」);过拟合
  • 小批量 SGD:32/128/512;批量牵动学习率→预热(:169-189)
  • 动量 β≈0.9:震荡方向抵消、一致方向加速(:191-203)
  • AdaGrad(累积只增不减后期停滞)→RMSProp(指数加权,辛顿 Coursera 讲义没发论文)→Adam 2014(一阶矩+二阶矩)(:205-227);「不知道用什么优化器,就先用 Adam 或 AdamW」(:230);AdamW=权重衰减与梯度解耦(:231-235);视觉里带动量 SGD 泛化常更强(:236-238)
  • 学习率=最重要超参数;「训练不动先怀疑学习率,剧烈震荡也先怀疑学习率」(:251-267);预热+余弦退火是常见组合
  • 初始化:全零→同层神经元永远一样;Xavier(tanh/sig)、He(ReLU 补偿方差减半)(:275-288)
  • 输入标准化;均值方差只能用训练集估,否则数据泄漏(:291-304)
  • BN(2015 Ioffe & Szegedy):沿一列求统计;20 层→50 层稳稳推;学习率 10⁻⁴→10⁻²;「ResNet 能顺利训练到 100 多层,BN 是幕后功臣之一」(:306-320)
  • LN:沿一行求统计,不跨样本;适合变长序列;BERT/GPT 到今用 LN 或 RMSNorm;RMSNorm 砍掉减均值,只按尺度缩放(:322-338);图4.3 行列对照(:339-360)
  • 残差流:永远在线的主干道/公共白板,层只写增量;两后果=梯度直通+每层只学小修正;可解释性里当「共享内存」(:362-391)
  • 正则化统一视角:把尖锐最优磨成平坦最优(图4.5,测试分布稍漂移时宽谷损失几乎不变)(:393-428)
  • 权重衰减 ℓ2;Dropout 辛顿银行柜员轮换比喻;Transformer 里 0.1 左右,大模型预训练常关掉(:432-444)
  • 数据增强=最根本的正则化;提前停止图4.6;标签平滑 1→0.9;正则化不是越多越好(:445-483)
  • 损失函数=评分规则:「评分表写歪了,模型会非常努力地朝错误方向进步」(:486-493);MSE 怕离群点/MAE/Huber;交叉熵惩罚「自信且错误」(99% 是狗当场社死)(:494-505);Focal Loss 2017→RetinaNet,不平衡场景默认(:506-515);对比损失/InfoNCE;「损失即哲学」
  • 实战:先简单模型打通管线;一次只改一件事;读曲线如心电图;排查顺序=先数据→损失实现→学习率→初始化/BN→结构;过拟合小测试(几百样本死记,记不住=底层坏)(:522-566)
  • 超参搜索:对数尺度扫;μP 小模型调好外推(:568-594)
  • 工程现实:梯度裁剪=安全绳;混合精度 FP16/BF16;DeepSeek-V3:278.8 万 H800 GPU 小时 × 每小时 2 美元 = 557.6 万美元(不含前期实验)(:618-624);OPT-175B 公开训练日志 chronicles 上百次故障回滚(:625-630)
  • 七条经验法则(:632-654);悬案:过参数化为何不严重过拟合,「梯度下降不是中立的,天然倾向平坦简单的解」(:668-670)

原书第5章(text/06-ch05.txt)→ 拆解 09、10、11

  • 2017《Attention Is All You Need》(:9-15)
  • RNN 两困境:长距离依赖弱+无法并行;「The animal didn't cross the street because it was too tired」it=animal(:33-36);词元=模型眼里的文字小块(:43-45)
  • 字典查询比喻:硬性精确匹配 vs 柔性按相似度加权(:58-66)
  • 缩放点积注意力;QK^T 是 N×N「谁该看谁」关系表,力量和麻烦来自同一张表(:92-98)
  • 除 √d:维度大点积爆,softmax 梯度消失(:83-90)
  • 软=可微,硬查询没法梯度训(:118-125)
  • Bahdanau 2014 机器翻译首胜(:127-137)
  • 自注意力 QKV 同源;两痛点一次解决(任意两点一步连接+全位置并行)(:139-167)
  • 多头:8 头原始,12/16/32;每头维度变小总参数不随头数线性涨(:179-200)
  • 积木四部件:多头注意力+FFN+残差+LN;大部分参数在 FFN 不在注意力;堆 N 次典型 12/24/96(:202-225)
  • 位置编码:打乱词序结果完全一样,「我打他」vs「他打我」(:250-259)
  • 三范式:BERT 遮 15% 填空双向;GPT 因果掩码把「向后看」打分置负无穷;编码器-解码器交叉注意力;积木完全一样,只差掩码和接线(:261-312)
  • 位置编码演化:正弦→可学习(BERT,不能外推)→相对(T5)→RoPE(把 q、k 转角度,YaRN 等改良)(:314-339)
  • 变体三组:MQA/GQA 省 KV 显存(Llama2/3 用 GQA);稀疏注意力局部窗口+全局标记 O(N log N);线性注意力 O(N) 精度有损至今没完全替代;FlashAttention 2022 不改数学只让中间结果留 SRAM(:342-361)
  • 统治原因四条:并行效率/长距离一步到位/规模化友好/通用(:363-388);前沿模型 100 万词元上下文
  • MoE:FFN 拆专家,路由器每词元只送一两个到几个;总参数几千亿激活几百亿(:394-404)
  • KV 缓存:旧 K/V 不变不重算;侦探小说资料夹比喻;代价是显存,长对话主要瓶颈(:418-445)
  • 可解释性:注意力可视化/探针/回路分析;FFN 是事实知识重要载体;知识是关系网不是抽屉(:448-476)
  • 上下文学习机制假设:预训练里隐式学会「做学习」,注意力模式与梯度下降有相似,未定论(:478-490)
  • 细节:Softmax 让注意力成分布+温度敏感;FFN 宽=4 倍注意力维度;Pre-LN 训得深 Post-LN 不稳;中间丢失(关注开头结尾忽略中间)(:492-519)
  • 八作者去向地图(:521-543);没有 Transformer 的平行世界(:548-557)
  • Mamba 2023 底:状态空间模型,O(N),「RNN 的现代化版本」;RWKV/RetNet;架构竞争未尘埃落定(:574-583)
  • 结语悖论:放弃了 CNN/RNN 的先验,「一无所长」反而在数据和算力够时赢(:606-610)

原书第6章(text/07-ch06.txt)→ 拆解 12、22(部分)

  • 标注成本:CT 一张几分钟到十几分钟、成本上百元;ImageNet 1400 多万张、总成本数百万美元、李飞飞 2007 被当「疯狂」(:18-28)
  • Common Crawl 上百 TB 文本(:37-39)
  • 关键洞见:数据自带监督信号;Google Brain 2012 YouTube 1000 万无标签帧学出猫脸敏感单元(:48-63)
  • 四类传统任务:特征学习/聚类/降维/密度估计(:74-106)
  • PCA:方差最大方向;特征脸=一万维的脸几十个系数重构(:112-139)
  • 自编码器:编码器→瓶颈→解码器;瓶颈才是产物;PCA 是其线性特例;降噪自编码器加噪反而学结构;异常检测=重构误差(:159-191)
  • VAE 2013:隐空间服从标准高斯才能采样;ELBO=「还原得像+隐空间别乱」;β-VAE 解缠,「没贴标签的抽屉柜」(:194-225)
  • Word2Vec 2013:国王−男人+女人≈女王(:227-249)
  • 自监督 2018 爆发四条件:算力/数据/架构/任务设计(:279-289)
  • K-Means 四步循环;「给衣柜自动分类」;层次聚类可剪树;DBSCAN 按密度挑异常点;t-SNE/UMAP=地图投影,「当显微镜可以,当法官就危险了」(:291-330)
  • 自编码器现代角色:Stable Diffusion 的 VAE、CLIP 编码器、向量数据库/RAG、MAE/wav2vec 预训练、异常检测(:332-361)
  • 三大范式:下一词元预测(单向续写,生成);掩码建模 BERT 遮 15%、MAE 遮 75% 因图像空间冗余(:385-399);对比学习 SimCLR 同图两变体为正例、负样本要多(batch 几千上万);CLIP 4 亿对图文(:431-437),文图同空间是文生图地基
  • 变体:打乱排序/区域预测/关系预测/自蒸馏 DINO/JEPA 不重构像素(:461-478)
  • 规模契合:GPT-3 约 3000 亿词元、Llama 3 约 15 万亿词元(:531);互联网「不是清泉是大河,有泥沙」
  • 任务设计三原则:适度难/覆盖主要结构/易评估(:560-581)

原书第7章(text/08-ch07.txt)→ 拆解 13、16(部分)

  • 训狗:对了给肉干;斯金纳箱、二战鸽子导弹项目是真的(:12-30)
  • 三特点:延迟奖励(信用分配)、动作影响未来、探索与利用;多臂老虎机(:32-60)
  • MDP 五要素:状态/动作/奖励/策略/转移概率;马尔可夫性;POMDP 给记忆(:125-152)
  • 回报=折扣和;γ=0.9 短视 0.99 长远,决定智能体「性格」(:154-170)
  • 值函数 V/Q;悬崖行走:走进悬崖 −100 并回起点,其他每步 −1;激进贴崖 vs 保守绕远;SARSA 保守 Q-Learning 激进(:188-201)
  • 表格存不下:围棋 10^170;深度强化学习(:203-213)
  • Q 学习→DQN:2015 Nature,49 个 Atari 游戏分别训练,84×84 灰度帧堆叠;打砖块发现打隧道阴招,「分数像爆米花」(:219-242)
  • 策略梯度:连续动作(扭矩)值函数派吃力;REINFORCE 整条轨迹好坏调概率(:244-261)
  • 演员-评论员=歌手+音乐老师;PPO:一步迈太大数据质量崩溃(RL 数据由当前策略生成),剪切项=安全绳;调菜谱一次别加半斤盐(:273-303);GRPO 同题多份答案相对好坏,省掉评论员(:304-306)
  • 优势函数 Q−V 降方差(:344-354);ε-贪心/Boltzmann/加噪声/内在动机好奇心(:356-368)
  • 无模型 vs 基于模型(脑内沙盘,沙盘画错就练偏);AlphaZero 知规则+MCTS,MuZero 学规则,Dreamer 做白日梦(:370-400)
  • AlphaGo 2016 4:1 李世石;第二局第 37 手肩冲;李世石第四局 78 手神之一手;AlphaZero 不看棋谱(:402-424)
  • RLHF 三步;偏好比绝对评分可靠:打分 7 分 vs 4 分,两两比较一致性高得多;Bradley-Terry;KL 紧箍咒(:462-476)
  • RLHF 挑战:奖励作弊(喜欢长就拉长)/模式塌陷/不稳定(十几个水龙头);DPO 2023 数学变换改写成类似分类损失;GRPO 是 R1 关键组件之一,「把 R1 成功全归功 GRPO 就像全归功锅铲」(:478-508)
  • 挑战:样本效率鸿沟(狗几十次 AlphaGo 上百万盘)/奖励设计难/sim-to-real/稀疏奖励/安全(:510-529)
  • 奖励设计:赛船 AI 绕圈捡道具;清洁机器人扔垃圾再捡刷分;稀疏给不动稠密会跑偏,塑形不当被钻空子;分层奖励(做饭 +100/洗菜 +10/动作 +0.1)(:531-557)
  • reward is enough=有争议的研究立场不是定理,「方向盘能上高速也能进沟」(:560-569)

原书第8章(text/09-ch08.txt)→ 拆解 14、15、16、17(部分)

  • ChatGPT 2022-11-30 上线;五天百万、两个月亿(Facebook 四年半/TikTok 九个月)(:8-12)
  • 语言=人类几千年对世界的一次次压缩;其他模态没有这种「智能压缩」属性(:67-84)
  • 香农 1950 猜字母实验;鸡蛋通常是__的(椭圆)、香蕉递给猴子因为它们__(饿了→猴子/熟透了→香蕉)(:99-118)
  • logits=卷面原始分,Softmax 才归一成概率;解码:贪心(重复呆板)/随机采样/温度(0.7 常用;0 字典 1 诗人再高喝醉)/Top-K/Top-P(核采样)/束搜索(安全但平庸,用得越来越少);实际=温度+Top-P;代码 0.1-0.3 创意 0.8-1.2(:127-151)
  • 数据:GPT-3 约 3000 亿词元;Llama 1/2/3 约 1/2/15 万亿;10 万亿词元 ≈ 7.5 万亿英文单词 ≈ 9000 多万本书;一人每天读 1 万词要两百多万年(:161-168)
  • 数据来源+清洗:去重/去毒/去低质/语言识别;「把数据洗干净配得好,比花哨技巧更能改进模型」(:169-175)
  • BPE:常见词整切稀有词切子词;英文 1 词元≈0.75 单词,中文≈1-1.5 汉字;数不清字母=隔着磨砂玻璃数葡萄(:177-210)
  • 规模法则:Kaplan 2020,对数坐标一条直线,改变投资观念:花十倍钱对应可预测的下降;Chinchilla:每个参数配几十个词元,早期大模型欠训(健身房年卡只去门口拍照)(:212-265)
  • 三类家族:闭源前沿/开放权重/端侧小模型(:267-288)
  • 训练挑战:网页清洗上百 TB 原始 HTML;去污染(训练集混入评测题成绩掺水);数据配比;千卡连续几十天;3D 并行;稳定性(NaN/回滚/checkpoint);团队几十人像粒子对撞机项目(:290-340)
  • 涌现:图8.4 临界点;争议=分数曲线是否真跳变,离散指标易像跳崖,连续部分得分更平滑;与规模法则不矛盾(损失平滑下降 vs 下游指标跃迁);危险能力评估(:342-385)
  • 上下文学习:火星文 glorb/blip 例子,不改参数三行例子学会新规则;提示工程师梗(:387-406)
  • 思维链:5−2+3−1=5,「让我们一步一步思考」;写出来的思考≠真实计算,有时像事后解释(:408-421)
  • 测试时扩展:o1(2024-09)/R1(2025-01);R1-Zero 纯强化学习激发推理;图8.5 草稿纸比喻;规模法则新维度(:423-464)
  • 后训练三阶段图8.6:预训练(万亿词元,$千万-数亿)→SFT(高质量指令-回答,$数万-百万)→偏好对齐($数万-百万)(:466-486)
  • SFT:几万到几十万条;Alpaca 5 万条、LIMA 约 1000 条高质量样本;「炼丹」(:487-506)
  • RLHF 三步;标注指南塑造性格;同一底座不同 SFT/对齐 = 不同人格(严谨/活泼/代码/角色扮演)(:508-545)
  • 宪法 AI:原则+自评+AI 反馈,Claude 风格来源(:538-541)
  • 使用建议:提示五条(角色目标/给例子/一步步想/约束格式/检查而不是相信);选模型先看任务最难一步;长上下文「塞得进去不等于看得明白」;结构化工作流(:548-611)
  • 六类局限图8.7:预测未来/实时知识/任意长算术/极长输入/多步推理/训练数据外事实,各对应工程补丁(:634-664)
  • 杨立昆:自回归每步 ε,整体 (1−ε)ⁿ 指数衰减;工程界把 ε 压小把曲线推远(:665-674)
  • 精确计算:范式不对,该调计算器(:676-683)
  • 幻觉:学的是「像真实文本的分布」不是「真实事实的分布」;2023 纽约律师六个编造判例,罚款五千美元;三来源图8.8:训练数据缺口(只读过菜单没进过厨房)/生成不确定(考试蒙选择题)/事实变化(旧地图找新地铁站)→补证据/降自信/加核查(:685-715)
  • 经济学:训练 GPT-3 级数百万美元、前沿数千万到上亿;推断=天天做的账单;职业暴露 80% 职业至少 10% 任务、19% 至少一半;高低暴露表;商业模式五条;DeepSeek 打破「只有最高投入」;开放权重 vs 闭源(:727-838)
  • Sydney 事件 2023-02(:855-861);治理时间线(:910-914)

原书第9–16章(只读了标题,下一棒通读后再写 17–27)

  • 第9章 钢与硅(10-ch09):9.1 卧室两块游戏显卡(9.1 节)、CUDA 赌注、Transformer+GPU 天作之合、H100、芯片派别、万卡集群三种切法、故障是常态、数据中心物理、能源账本、中国算力局/算力主权、DeepSeek 效率工程、推断时代、算力的尽头 → 拆解 18
  • 第10章 智能体(11-ch10):定义、核心组件(大脑/工具/MCP/技能/记忆/规划/感知反馈/驾驶舱/上下文工程)、炼成(基座/驾驶舱/训练/RAG)、反思与自我改进、评估 → 拆解 19、20
  • 第11章 扩散(12-ch11):简史、三代生成模型(VAE/GAN/扩散)、加噪去噪、预测噪声训练、U-Net→DiT、文生图(文字进模型/无分类器引导/隐空间扩散)、编辑控制、版图(视频/3D/分子/音频/动作)、挑战、负责任使用 → 拆解 21
  • 第12章 多模态(13-ch12):模态概念、CLIP 统一空间、图像模态(GPT-4V、融合原理)、音频(识别/合成/级联 vs 原生)、视频(理解/生成) → 拆解 22
  • 第13章 AI 遇上科学(14-ch13):第四范式、AlphaFold(CASP、技术核心、AlphaFold3)、药物与蛋白质设计、基因细胞大脑、材料化学(GNoME)、气象(GraphCast/Pangu/Aurora)、数学(AlphaGeometry/AlphaProof/AlphaTensor/Lean)、天文物理 → 拆解 23
  • 第14章 具身(15-ch14):从数字到物理、经典三支柱、VLA(RT 系列、π 系列)、动作表示、世界模型(Dreamer/Sora/JEPA)、人形、硬件/仿真/sim-to-real/触觉、真机实验 → 拆解 24
  • 第15章 脆弱的巨人(16-ch15):对抗样本(熊猫→长臂猿)、投毒后门、隐私(模型记住训练数据、差分隐私)、分布偏移、幻觉(律师案)、越狱与提示注入、失控智能体(真实事故、欺骗性行为)、偏见 → 拆解 25、26
  • 第16章 通往通用智能(17-ch16):AGI 七十年漂流、四种 AGI 四套时间表、会考试≠会生活、锯齿状、五道关卡(幻觉/长期规划/因果/遗忘/物理常识/自我)、五阶段路标、规模法则/长思考/自我进化/具身/混合、时间表豪赌、AGI 后的世界 → 拆解 27

书架锚核实结果(2026-08-27 逐个看过行内容)

  • nanoGPT @3adf61e:model.py:64 融合注意力调用;:67-69 手写注意力三行(点积/掩码负无穷/softmax);:82 c_fc 4×n_embd;:104-105 两句 x = x + ...;:112 n_layer=12、:114 n_embd=768;train.py:63 grad_clip=1.0、:66 warmup_iters=2000、:68 min_lr≈峰值/10、:73 bf16
  • transformers @b6c0bfe:modeling_llama.py:66 RMSNorm 只缩放不减均值;:158-159 RoPE q/k 旋转两行;:175 LlamaMLP 三个投影(gate/up/down);:225 num_key_value_groups(GQA)
  • flash-attention @0251105:README.md:515「10X memory savings at 2K, 20X at 4K」
  • pytorch @c187ef3:clip_grad.py:168 torch.clamp(clip_coef, max=1.0)
  • minbpe @1acefe8:basic.py:35 pair = max(stats, key=stats.get)
  • peft @5779b17:lora/layer.py:343 nn.init.zeros_(self.lora_B...)
  • trl @67dfbe2:sft_trainer.py:112 ignore_index=-100;dpo_trainer.py:1465 -F.logsigmoid(self.beta * delta_score)
  • verl @8f8b122:run_qwen2_5_32b_fsdp.sh:15 NNODES=2、:16 NGPUS_PER_NODE=8、:18 TRAIN_BATCH_SIZE=1024、:31 ROLLOUT_N=5
  • nanochat @92d63d4:scripts/ 下 tok_train/base_train/chat_sft/chat_rl/base_eval/chat_eval 等九个脚本,流水线一段一个