跳到主要内容

什么是学习 — 压缩、所罗门诺夫归纳与大语言模型的第一性原理

这一章讲三件事: 1956 年麦卡锡提出的问题——只看机器的输出,怎么猜出这台机器 (图灵机求逆)——怎么被所罗门诺夫改写成"给定序列开头,预测后续",又怎么在 67 年后被 OpenAI 的伊利亚认作 GPT 的数学基础;学习=压缩这条等式的完整版: 柯尔莫哥洛夫复杂性(压缩的极限)、蔡汀(最优压缩不可计算的证明)、 列文(加了时间预算的可计算版)、本内特(解压的时间);以及这场理论怎么把 波普尔、库恩、奥卡姆剃刀一并收编。 原书自评:"也许不是理论落后于实践,而是太超前了。"1

1. 这一章讲什么

第 07 章留了一个悬案:为什么单向的 next token prediction(GPT)打赢了直觉上更强的 双向 BERT?第 08 章埋了一个立场:学习是压缩,不是记忆。本章把这两个欠条一次 还清。

历史的前情是:1956 年达特茅斯会议期间,麦卡锡和所罗门诺夫有过一场改变两个学科的 对话。麦卡锡当时刚在香农主编的《自动机研究》文集里发了一篇 5 页短文《图灵机定义的 逆函数》,问题是:给定一个图灵机的输出,怎么反推输入?——"通过观察一个黑盒子 (图灵机)的输出,力图猜出黑盒子的内部构造"2。麦卡锡意识到这等价于 "在所有可能的英文文章中以某种顺序寻找一个猜想的证明"。

所罗门诺夫把问题重述成:"给定一个序列的初始段,预测这个序列的后续部分。" 麦卡锡当场反问:"这不就是往后硬套吗?"——外插——就是拿已知规律往后硬延伸——全场被问住。第二天麦卡锡回过味来,给出了原书 引用的通俗版:"假设我们发现一座老房子里有一台计算机正在打印你说的序列, 已经接近序列末尾,马上要打印下一个字符,你敢打赌它会打印正确的字符吗?"3 ——原书点明:他们说的"next symbol",就是今天的 next token

2. 顶层全景

1913/1944 博雷尔"无限猴子"与博尔赫斯"巴比伦图书馆"(枚举一切文本的思想实验)

1948 图灵《智能机器》:枚举所有程序 = 学习("主动性");但不停机

1956 麦卡锡:图灵机求逆(《自动机研究》5 页)──达特茅斯对话──→
1956-08-14 所罗门诺夫备忘录《An Inductive Inference Machine》

1964 所罗门诺夫《归纳的形式理论》:找编码最短的程序为数据建模
↓ ↓
1965 柯尔莫哥洛夫:描述复杂性 1966 蔡汀:贝里悖论 →
KC(x)=最短程序长度 随机性=不可压缩 →
(不变性定理:表示无关) KC 不可计算("不完全性")
↓ ↓
1973 列文:通用搜索 L-search(Kt 加时间预算 → 可计算)

1988 本内特:逻辑深度(近乎最短程序的运行时间 = 解压成本)

2023 伊利亚(赛蒙斯研究所演讲):GPT 的数学依据就是所罗门诺夫归纳

对号入座:训练=压缩;参数量≈KC;推断=解压;BERT 双向 ≠ 归纳,GPT 单向 = 归纳

图说:一条 70 年的暗线从达特茅斯会议的走廊里长出来,最终盖住了整个行业。
主走查在第 3.1 节:序列 (3,5,7) 的两种续写与两种程序长度。

3. 核心原理

3.1 主走查:序列 (3,5,7),给两个"程序"称重

所罗门诺夫归纳的定义,原书给的形式化版本是:给定序列 (x1, x2, …, xn),预测 x(n+1);归纳就是找到一个编码长度最短的图灵机程序,能为已知序列建模,从而预测 后续4。拿原书自己的例子走一遍:

观察序列:(3, 5, 7)。下一个数是什么?

假说 A:程序"打印正奇数"
伪代码:n=3; 循环{ 输出 n; n=n+2 } 长度约 20 个字符
续写:9, 11, 13, …
假说 B:程序"打印质数"
伪代码:n=3; 循环{ 输出 n; n=下一个质数(n) } 长度约 60 个字符
续写:11, 13, 17, …
假说 C:程序"打印这仨数,然后结束" 长度约 25 个字符
续写:无。

判决(所罗门诺夫的判决规则):
能覆盖同样数据的最短程序,置信度最高。
两个都能解释 (3,5,7):A 更短 → 更可信 → 押 9;
B 也能解释,但"打印质数"的描述复杂度更大 → 先验更低;
C 什么都预测不了(数据之后的输出为空)→ 不算解释。

图说:序列的"描述复杂度"= 输出该序列的最短程序长度。
归纳不是"找规律找感觉",是给每条候选规律按程序长短称重。
(各伪代码长度为演示标注;长短的相对关系与原书一致:
"打印素数的程序要比打印奇数的程序复杂很多"。)

4

这就是"在下一个字符上下注"(麦卡锡语)的全部含义——也是 GPT 每一步在做的事: 给下一个 token 列概率表时,那些概率背后站着一大群"候选程序",短的权重高。 所罗门诺夫利用贝叶斯(按新证据不断更新把握大小的数学)定理把这层直觉做成了严格的先验分布:程序越长(越复杂), 先验置信度随长度呈指数衰减——这就是奥卡姆剃刀原理的算法化5

它为什么不可计算? 因为"找最短程序"要求枚举(一个一个列出来)所有程序并验证——枚举过程 不停机(你永远不知道会不会有更短的程序稍后出现)。图灵 1948 年就指出, "所有学习都可以归约到这个枚举方法",同时"计算理论告诉我们这个枚举过程不停机"6所以实践只能近似:放宽"最短"的要求,用可学习的东西(比如神经网络这个 通用近似器)去逼近7

3.2 从监督到自监督:一段拼接的戏法

原书给了一个极简但承重的改写:监督学习可以归约为自监督学习8。 拿一个具体例子走一遍(任务与配对为演示):

监督版任务:给定 (图像, 标签) 对若干,预测新图像的标签
样本:(照片1, "猫"),(照片2, "猫"),(照片3, "鱼")……
要学的是函数 c = f(x)。

自监督改写:把标签并进序列,把"分类"变成"预测下一项"
序列化:照片1 → 猫 → 照片2 → 猫 → 照片3 → 鱼 → 照片4 → ?
任务:看到照片4,预测序列的下一项。

图说:两个任务是同一个任务——"给定前文,填下一项"。
分类的"老师"消失了,只剩"下一个是什么"。
这一步拼接,就是"下一 token 预测"能吃下一切监督任务的机关。

这一节是本章与第 07 章的衔接点:GPT 之所以能"什么任务都做",不是因为有人给它 写了个分类器(专门判断类别的程序)。

而是因为分类、翻译、问答全都能被序列化(摊平成一条前后串)成"预测下一个 token"

3.3 柯尔莫哥洛夫:给"信息量"换一把算法的尺子

香农信息论度量信息靠频率(熵:意外程度);柯尔莫哥洛夫 1965 年在苏联创办的 《信息传输问题》创刊号上,用一篇 7 页的文章给出了第三种度量:算法—— 一段信息的信息量 = 生成它的最短程序的长度(记作 KC(x))9

他有一句被原书反复借用的判词:"信息论在逻辑上要先于概率论,而不是以后者为基础。"9 他还把三种信息观排了序:频率(香农)、组合学、算法——最坚实的是算法。

不变性定理让这个定义站得住:KC 用不同语言(C、Java、图灵机代码)算出的 最短描述长度只差一个常量(写"你好世界"所需的胶水代码长度)——所以 KC 是对象自己的属性,不依赖表示。原书指出这个不变性定理可视为丘奇-图灵论题的 推论:足够强的计算模型本质等价10

命名史原书讲得很公道:柯尔莫哥洛夫 1968 年读到所罗门诺夫后主动引用(俄文英文各一次), 使所罗门诺夫"在苏联的名声比在西方更响亮";这套理论因此也叫SKC 复杂性 (所罗门诺夫-柯尔莫哥洛夫-蔡汀)——三个人独立发明,互相致敬, 原书把它比作能量守恒定律的独立发现(迈尔、焦耳、赫尔姆霍兹)11

3.4 蔡汀:随机性、不可计算性与一场没赶上的雪

蔡汀从贝里悖论("不可能用少于十九个汉字命名的最小正整数"——这句话本身 就命名了它)出发独立重造了同一理论:他发现绝大多数整数的最短命名方式就是直接 打印自身——没有更短的描述。他把这样的数称为无趣的、不可归约的、随机的12

由此他证明了 KC 不可计算(他当时称之为"不完全性")。原书由此给出一个 惊心动魄的推论,值得全文保留:

一个系统可以轻易地被解释,其预测能力肯定是有限的。……不可解释是几乎必然的, 可解释是偶然的。13

这一句直接回答了第 04 章的欠账:"深度学习的机制没有令人满意的解释"不是研究 不够,可能是必然。可解释的是压缩得不够狠的;压得最狠的模型,恰恰最难解释。

蔡汀还留下一段科学史佳话:1974 年他打电话给哥德尔,说用贝里悖论也得到了不完全性 定理的版本。哥德尔说"用什么悖论无所谓!"。两人约定见面;见面那天纽约下雪, 哥德尔的秘书来电:教授怕雪,不去办公室了。蔡汀一生再没见到哥德尔。 1991 年他在维也纳演讲,当地报纸的标题:"比哥德尔还哥德尔!"14

3.5 列文:给压缩加上计时器

KC 有个工程死穴:不可计算。苏联数学家列文(柯尔莫哥洛夫的学生,因政治原因没拿到 博士学位,1978 年移民美国后 MIT 补授)在 1973 年一篇两页的论文里同时做了 两件事:定理 1 独立提出 NP 完全性(所以教科书今天叫库克-列文定理); 定理 2——通用搜索(L-search):给"最短程序"加一个时间预算项, Kt(x)=min{程序长度+log(运行时间)},这个复杂度(算这件事要花多少计算)是可计算的——只要逆函数存在, 通用搜索总能找到它15

这段历史的动人处:定理 2 当时被全世界忽略(论文列出它之后就结束了,连说明都没有); 所罗门诺夫知道列文在苏联的遭遇后,联系多所学校恳请帮助他,还专门写报告补齐了 定理 2 的证明16通用搜索正是麦卡锡 1956 年"图灵机求逆"问题的可计算解—— 两个人隔着二十年和铁幕,把同一个问题做完了。

3.6 本内特:解压要多久——逻辑深度

KC 度量"压得多狠",物理学家本内特(量子密码 BB84 的那位)1988 年补上另一半: 逻辑深度 = 近乎最短的程序跑出输出所需的时间——直觉上,压缩考虑空间成本, 解压有时间成本;有些对象压得很短,但解压极慢(比如几亿年宇宙演化压缩成的 一块化石)17

原书把三个量对到大语言模型上,这张对照表是全章的枢纽18:

理论量大语言模型对应物
压缩过程训练
柯尔莫哥洛夫复杂性(最短程序长度)模型的参数量(内部可调数的总个数)
逻辑深度(解压时间)最短推断(inference)时间

原书顺手送了一个翻译警告:大模型术语里的 inference 更合适的译法是推断 (统计意义),有别于逻辑意义的"推理"(reasoning)——而思维链(CoT)里恰恰 有逻辑意义的推理,两个词在中文里打架19读任何中文大模型资料,先确认 "推理"说的是 inference 还是 reasoning。

3.7 对号入座:GPT 对 BERT、以及那场压缩实验

现在还第 07 章的欠条。原书的推理链20:

  • GPT 的 next token prediction,思想可追溯到所罗门诺夫归纳(给定前文,预测下文, 找最短解释);
  • BERT 的任务("从序列中抽走一项,猜它是什么")不是这个归纳的形式—— "所罗门诺夫归纳为我们提供了 BERT 不可能比 GPT 更强的证据"(无数学证明, 但有理论方向的支撑);
  • Transformer 只是实现 next token prediction 的一种手段——"探索以非神经网络 实现所罗门诺夫归纳的机制是一个有意思的课题"

实证侧,原书引了两项工作:"Language Modeling is Compression"(2023)在工程师中 引起热烈讨论;后续实验表明,用大语言模型做无损压缩,效果远好于基于哈夫曼编码的 各路压缩算法。原书还纠正了一个流行误解:大模型是"次优压缩"而不是有损压缩—— "任何函数都可被看作有损压缩",这个说法没有信息量;次优压缩仍然是无损的21

最后是那个历史注脚:2023 年 8 月 14 日,伊利亚在赛蒙斯计算理论研究所的演讲, 明确透露 GPT 的数学依据就是所罗门诺夫归纳法;他自称 2015 年独立想出了这套思路 ——原书补刀:"这也稍微晚了点儿,我们自然没法强迫他进行零知识证明。"22

3.8 哲学收编:老哲学的新名字

原书最后把一系列哲学传统收进压缩框架,这一节的密度极高,拆成对照表:

哲学传统在压缩框架里的身份
皮尔士的实效主义(溯因)所罗门诺夫归纳=其"精确版本";作者戏称"老派实效主义"
波普尔的证伪主义特例:数据证伪假设 → 返回第 2 步另立假说
库恩的科学革命特例:新模型与旧模型的 KC 差距大=范式转换;新范式的 KC 大概率更高、逻辑深度更深
奥卡姆剃刀定理化:置信度随程序长度指数衰减
伊比鸠鲁无差别原则同误差内可有多个大小相近的模型=多个解释
休谟的归纳问题不可解,但所罗门诺夫归纳给出"建设性的框架"

23

原书的两句收尾,一句戏仿,一句正经。戏仿亚里士多德:"求知是人的本性"→ "压缩是人的本性";正经的那句是全书的题眼:"我压缩,故我在" (I compress, therefore I am)——"压缩即物理世界规律在信息世界的体现"24。 连"适者生存"都被转写成"最压者生存"。

4. 作者的判断与证据

史实层:麦卡锡 1956 论文、所罗门诺夫备忘录的日期(1956-08-14)、1964 两部曲、 柯尔莫哥洛夫 1965 创刊号、蔡汀 1974 电话记录、列文 1973 两页论文、伊利亚 2023-08-14 演讲,均有文献与录音。

作者观点层(要分开):

  • "所罗门诺夫可算是大语言模型的先知"、"SKC 理论是大语言模型的第一性原理"—— 这是作者贯穿两版的中心论断;伊利亚的演讲是他最硬的支柱,但一家公司创始人的 事后追认不等于数学证明,原书自己承认"没有数学证明,但直觉上"20;
  • "明斯基因所罗门诺夫备忘录从神经网络转向符号"所引的是明斯基 2011 年的原话; 原书随即自批其讽刺性:"这一转向使得神经网络停滞近 20 年,但最终实现所罗门诺夫 归纳的又恰是神经网络"25——历史的报复性幽默,作者观点与史实分列;
  • 哲学收编一节是作者个人最激进的写作:把皮尔士、波普尔、库恩全部变为特例。 这在哲学上是强主张,如果错,会错在: 所罗门诺夫归纳预设"程序长度先验", 而科学共同体的"接受一个理论"还包含可交流性、教学成本等非长度因素—— 若这些因素不可归约为描述长度,收编就只是类比。

原书标注存疑处:BERT 与 GPT 的强弱之争,原书明确写成"虽然没有数学证明, 但我们直觉上可以猜测……这作为一个开放问题留给读者"20——理论的方向证据 (所罗门诺夫归纳偏向单向)与数学证明之间,原书诚实地留着这条缝。

5. 边界与局限

  • 所罗门诺夫归纳不可计算是定理级事实,工程只能近似;神经网络为什么是好的 近似器,原书只有一句"通用近似器是很好的候选机制"7——这个 gap 至今没有 理论闭合,不要把"第一性原理"读成"完整理论"。
  • "参数量≈KC"是类比不是等式:参数量是最短程序的上界(模型是程序的一种 实现,未必最短);原书用"可借此研究"的措辞,分寸如此26
  • 压缩实验(LLM 压文本胜过压缩算法)针对特定数据分布,不意味着 LLM 是 通用最优压缩器。
  • 本章不含 Solomonoff 归纳的技术定义(先验分布的严格构造),原书只给公式形态; 数学细节见李明与维特涅的教科书(原书称该领域"圣经")。

6. 可带走的

  1. 学习的最小形式是"给序列续尾":分类、翻译、问答都能序列化成它—— 这就是 next token prediction 能吃下一切任务的原因;
  2. 归纳=给候选规律按"程序长度"称重:(3,5,7) 之后的 9 赢了 11,因为 "奇数"比"质数"短——奥卡姆剃刀第一次有了可计算的形态;
  3. 学习=压缩=找最短程序;压缩的极限(柯尔莫哥洛夫复杂性)表示无关, 只差一个常量;
  4. 最优压缩不可计算(蔡汀):所以可解释是偶然的、不可解释是必然的—— 模型越强越难解释,可能不是工程缺陷而是数学宿命;
  5. 给压缩加上时间预算就变得可计算(列文 L-search)——工程永远买的是 "足够好+来得及",不是最优;
  6. 训练=压缩,参数量≈程序长度,推断=解压(本内特逻辑深度):这张对照表 是谈论大模型成本结构的理论底座;
  7. GPT 赢 BERT 有理论方向:单向续写是归纳的形式,双向填空不是—— 直觉(双向更强)输给了结构(归纳更根本);
  8. inference 译"推断"不译"推理":中文大模型资料里这两个词打架, 先确认再说;
  9. "我压缩,故我在":这句话当口号可以,当纲领要带着它的边界—— 归纳的先验(为什么短的更可信)本身是这条理论的公理,不是定理。

7. 原文地图

主题原书章原文位置
理论超前于实践、先知第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:13(搜「数学基础」) · text/15-ch11.txt:16(搜「奠定了数学基础」)
理论太超前了第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:571(搜「太超前」)
麦卡锡求逆问题第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:60(搜「逆函数」) · text/15-ch11.txt:69(搜「黑盒子」) · text/15-ch11.txt:74(搜「寻找一个猜想的证明」)
达特茅斯对话与老房子打赌第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:79(搜「初始段」) · text/15-ch11.txt:82(搜「外插」) · text/15-ch11.txt:84(搜「老房子」)
next token 的来历、上下注第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:180(搜「next token」) · text/15-ch11.txt:179(搜「上下注」)
无限猴子与博尔赫斯第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:95(搜「猴子」) · text/15-ch11.txt:100(搜「巴比伦图书馆」)
图灵 1948 枚举不停机第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:111(搜「主动性」) · text/15-ch11.txt:113(搜「不停机」)
备忘录日期、明斯基转向第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:117(搜「An Inductive」) · text/15-ch11.txt:120(搜「转向」) · text/15-ch11.txt:124(搜「停滞了近20年」)
1964 两部曲、三个实例第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:135(搜「A Formal Theory」) · text/15-ch11.txt:139(搜「伯努利」)
Oxbridge 一人公司第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:142(搜「Oxbridge」)
定义:最短程序建模第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:155(搜「最短」) · text/15-ch11.txt:156(搜「描述复杂度」)
(3,5,7) 奇数与素数第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:162(搜「3,5,7」) · text/15-ch11.txt:20(搜「9」) · text/15-ch11.txt:166(搜「素数」)
监督归约为自监督第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:169(搜「自监督」) · text/15-ch11.txt:170(搜「序列对」)
学习当压缩、贝叶斯、通用近似器第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:4(搜「压缩」) · text/15-ch11.txt:186(搜「贝叶斯」) · text/15-ch11.txt:186(搜「通用近似器」)
文法发现、内生文法=先验第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:193(搜「文法发现」) · text/15-ch11.txt:186(搜「先验概率分布」) · text/15-ch11.txt:198(搜「修辞」)
奥卡姆剃刀指数衰减第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:200(搜「这就是奥卡姆剃刀原理的体现」) · text/15-ch11.txt:200(搜「奥卡姆剃刀」)
柯尔莫哥洛夫 1965、三种方式第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:223(搜「1965年」) · text/15-ch11.txt:227(搜「三种方式」) · text/15-ch11.txt:231(搜「概率论」) · text/15-ch11.txt:234(搜「最短程序」)
不变性定理、算法熵第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:253(搜「不变性」) · text/15-ch11.txt:252(搜「柯尔莫哥洛夫论题」) · text/15-ch11.txt:256(搜「算法熵」)
SKC 命名、苏联名声第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:259(搜「1968年」) · text/15-ch11.txt:262(搜「SKC」)
柯尔莫哥洛夫奖章与瓦普尼克第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:267(搜「皇家哈洛威」) · text/15-ch11.txt:273(搜「瓦普尼克」)
蔡汀生平与贝里悖论第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:277(搜「蔡汀」) · text/15-ch11.txt:297(搜「贝里悖论」)
随机数、不可计算、"可解释是偶然的"第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:307(搜「随机的」) · text/15-ch11.txt:308(搜「不完全性」) · text/15-ch11.txt:309(搜「偶然」)
电话哥德尔、雪、比哥德尔还哥德尔第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:314(搜「哥德尔」) · text/15-ch11.txt:318(搜「无所谓」) · text/15-ch11.txt:330(搜「雪」) · text/15-ch11.txt:334(搜「比哥德尔还哥德尔」)
算法信息论=计算更基础第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:265(搜「算法信息论」) · text/15-ch11.txt:342(搜「更为基础」)
列文 1973 两页、库克-列文第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:351(搜「列文」) · text/15-ch11.txt:357(搜「Cook-Levin」)
定理 2 与通用搜索第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:350(搜「通用搜索」) · text/15-ch11.txt:372(搜「L-search」) · text/15-ch11.txt:376(搜「时间限制」) · text/15-ch11.txt:381(搜「可计算」)
所罗门诺夫帮助列文第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:370(搜「恳请」) · text/15-ch11.txt:245(搜「补齐」)
本内特逻辑深度第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:384(搜「逻辑深度」) · text/15-ch11.txt:393(搜「近乎最短」) · text/15-ch11.txt:396(搜「解压」)
训练/参数量/推断对照第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:403(搜「压缩时间」) · text/15-ch11.txt:404(搜「参数量」) · text/15-ch11.txt:405(搜「推断」)
inference 译推断、CoT第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:405(搜「推断」) · text/15-ch11.txt:407(搜「CoT」)
李明与维特涅、McDowell 奖第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:413(搜「李明」) · text/15-ch11.txt:423(搜「McDowell」)
胡特尔 AIXI 与 Hutter Prize第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:432(搜「AIXI」) · text/15-ch11.txt:435(搜「Hutter Prize」)
BERT 不可能比 GPT 更强第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:444(搜「抽走」) · text/15-ch11.txt:447(搜「不可能比GPT」) · text/15-ch11.txt:448(搜「非神经网络」)
基准落后于工程、伊利亚演讲第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:452(搜「基准」) · text/15-ch11.txt:457(搜「所罗门诺夫归纳法」) · text/15-ch11.txt:597(搜「2015」)
压缩实验、次优非有损第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:467(搜「Language Modeling is Compression」) · text/15-ch11.txt:469(搜「哈夫曼」) · text/15-ch11.txt:465(搜「有损」)
哲学收编(皮尔士/波普尔/库恩)第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:486(搜「皮尔士」) · text/15-ch11.txt:492(搜「paleo-pragmatism」) · text/15-ch11.txt:483(搜「证伪」) · text/15-ch11.txt:510(搜「库恩」) · text/15-ch11.txt:530(搜「休谟」)
模型不对、有用第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:505(搜「all models are wrong」)
压缩是人的本性、我压缩故我在第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:549(搜「压缩是人的本性」) · text/15-ch11.txt:558(搜「我压缩」) · text/15-ch11.txt:555(搜「最压者生存」)
能量守恒类比第11章 什么是学习?——大语言模型的理论与实践text/15-ch11.txt:563(搜「能量守恒」)

Footnotes

  1. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 571 段(text/15-ch11.txt:571,搜「太超前」)。

  2. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 60 段(text/15-ch11.txt:60,搜「逆函数」)、第 69 段(搜「黑盒子」)、第 73 段(搜「英文文章」)。

  3. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 79 段(text/15-ch11.txt:79,搜「初始段」)、第 83 段(搜「外插」)、第 84 段(搜「老房子」)与第 86 段(搜「next token」)。

  4. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 153-167 段(text/15-ch11.txt:155,搜「最短」)、第 156 段(搜「描述复杂度」)、第 162 段(搜「3,5,7」)、第 164 段(搜「9」)、第 166 段(搜「素数」)。原文:"打印素数的程序要比打印奇数的程序复杂很多,也就是说素数序列的描述复杂度要大于奇数序列的描述复杂度"。伪代码字符数为演示标注。 2

  5. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 199-200 段(text/15-ch11.txt:200,搜「这就是奥卡姆剃刀原理的体现」)。

  6. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 108-113 段(text/15-ch11.txt:111,搜「主动性」)与第 112 段(搜「不停机」)。

  7. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 186 段(text/15-ch11.txt:186,搜「贝叶斯」)与第 187 段(搜「通用近似器」)。 2

  8. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 169-177 段(text/15-ch11.txt:169,搜「自监督」)。拼接示例(照片/标签)为演示编的,归约机制与原文一致。

  9. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 223 段(text/15-ch11.txt:223,搜「1965年」)、第 227 段(搜「三种方式」)、第 231 段(搜「概率论」)、第 234 段(搜「最短程序」)。 2

  10. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 250-252 段(text/15-ch11.txt:253,搜「不变性」)。

  11. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 259-265 段(text/15-ch11.txt:259,搜「1968年」)、第 261 段(搜「SKC」)、第 561-568 段(搜「能量守恒」)。

  12. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 297 段(text/15-ch11.txt:297,搜「贝里悖论」)与第 305-307 段(搜「随机的」)。

  13. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 309-310 段(text/15-ch11.txt:309,搜「偶然」)。原文:"不可解释是几乎必然的,可解释是偶然的。一个系统可以轻易地被解释,其预测能力肯定是有限的"。

  14. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 314 段(text/15-ch11.txt:314,搜「哥德尔」)、第 318 段(搜「无所谓」)、第 330 段(搜「雪」)、第 334 段(搜「比哥德尔还哥德尔」)。

  15. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 351-357 段(text/15-ch11.txt:351,搜「列文」)、第 364 段(搜「通用搜索」)、第 376 段(搜「时间限制」)、第 381 段(搜「可计算」)。

  16. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 369-371 段(text/15-ch11.txt:370,搜「恳请」)。

  17. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 384-396 段(text/15-ch11.txt:384,搜「逻辑深度」)。化石类比为本拆解的补充说明(补充:不在书里,来自通用知识),原书的表述是"如果把归纳看作压缩过程,逻辑深度考虑的就是解压的时间"(第 396 段)。

  18. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 403-404 段(text/15-ch11.txt:403,搜「压缩时间」)。

  19. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 405-408 段(text/15-ch11.txt:405,搜「推断」)。

  20. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 440-449 段(text/15-ch11.txt:444,搜「抽走」)、第 446 段(搜「不可能比GPT」)、第 448 段(搜「开放问题」)。 2 3

  21. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 465-471 段(text/15-ch11.txt:465,搜「有损」)、第 468 段(搜「哈夫曼」)。

  22. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 456-457 段(text/15-ch11.txt:456,搜「赛蒙斯」)与第 597-598 段(搜「2015」)。

  23. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 474-531 段(text/15-ch11.txt:474,搜「philosophical formulation」,中文见第 474-485 段「科普版描述」)、第 486 段(搜「皮尔士」)、第 491 段(搜「paleo-pragmatism」)、第 499 段(搜「证伪」)、第 510 段(搜「库恩」)、第 514 段(搜「奥卡姆」)、第 515 段(搜「无差别」)、第 530 段(搜「休谟」)。对照表为结构化转写。

  24. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 549 段(text/15-ch11.txt:549,搜「压缩是人的本性」)、第 556 段(搜「最压者生存」)、第 558 段(搜「我压缩」)。

  25. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 120 段(text/15-ch11.txt:120,搜「转向」)与第 123 段(搜「停滞近20年」)。

  26. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 4 段(text/15-ch11.txt:4,搜「压缩」)与第 183 段(搜「参数量」)。原文:"参数量和token量之间的关系也可借此研究"。