这就是 ChatGPT — 本课题摘录
读了哪几章: 「它只是一次添加一个词」「真正让 ChatGPT 发挥作用的是什么」「那么它到底在做什么」。 读的是我们自己的中文拆解(书库里已验收的那份样板),不是原文。
为什么现在才补这一篇:账本第一轮把它判成「留给需要讲『模型是什么』时」。写讲义时发现,不讲这一层,后面六根轴全都悬空——「为什么需要一个循环」这个问题的答案就在这本书里。
它对本课题回答了什么
循环为什么必须存在:模型内部没有循环
这是全课题最底下的 一块砖。 书里在比较它和大脑时,专门列了一行:
它内部没有循环、不重新计算数据,这不可避免地限制了计算能力——而且书里说得很重,这个限制「即使与当前的计算机相比也是如此」。 (依据:书 · 这就是ChatGPT(What Is ChatGPT Doing…) §那么,ChatGPT到底在做什么?它为什么能做到这些? —— 书在「它像大脑吗」一节明确列出:底层结构像、生成语言的许多方面似乎相似、学习方式不像、而且「没有循环」——它内部不重新计算数据,这不可避免地限制了计算能力,即使与当前的计算机相比也是如此)
本课题存在的理由,一句话就在这里: 模型自己不会转圈,所以转圈这件事必须由外面的代码来做。
这解释了为什么「agent 循环」是一个工程问题而不是模型问题—— 无论模型多强,那个 while 都得有人写。
决定一的根源:每一步都从头算,算完就丢
生成不是「先构思、再打草稿、最后润色」。它在反复回答同一个问题:照目前这段文字,下一个词该是什么?问一次,写一个词,把加长后的文字再喂回去,重新问一遍。
每一步都是独立的一次计算,前一步的清单算完就丢掉了。 (依据:书 · 这就是ChatGPT(What Is ChatGPT Doing…) §它只是一次添加一个词 —— 生成是反复回答「照 目前这段文字下一个词该是什么」——问一次写一个词、把加长后的文字再喂回去重新问一遍;每一步都是独立的一次计算,前一步的可能性清单算完就丢)
「无状态」这个词在别处都是被当成既定前提用的(hands-on 那本用一个两轮演示展示它, 各家实现直接照着它设计)。这本书说的是它为什么是这样:因为生成本来就是一步一步现算的。
推论:本课题第一个决定(「一轮的输入怎么拼」)不是一个可选的优化,是唯一的信息通道。 模型能知道的一切,只有你这一次塞给它的那些字。
幻觉的根子:它追求的是「像」,不是「对」
书里对「该接什么」给的定义:看过海量人类写的文字之后,人们大概率会接着这么写。
这句话里没有「正确」两个字。 (依据:书 · 这就是ChatGPT(What Is ChatGPT Doing…) §它只是一次添加一个词 —— 书给「下一个词该是什么」的定义是「看过海量人类写的文字之后,人们大概率会接着这么写」,拆解文档指出这句定义里没有「正确」二字——它的好坏标准从来是「像人会写的」而不是「说对」)
拆解文档的评语值得原样带走:胡说不是它坏了,是它在忠实地执行「写得像」。
这一条把本课题轴 5(跑偏了怎么办)的必要性说死了: 跑偏不是异常,是它的正常 工作方式在没有外部约束时的自然结果。 所以那 13 种纠偏做法不是补丁,是必需品。
而且它解释了 hands-on 那本里「汇率是模型自己编的」为什么会发生: 一个数编得像模像样,就满足了它的目标函数。
一个计量单位:它吐出来的不是「词」,是 token
token 是它切分文字的最小单位,可能是一个完整的词,也可能只是词的一小截。 (拆解文档译作「标记」;本库统一用业界通行的 token,不再另造中文名。)
本课题所有跟「量」有关的东西——上下文窗口、缓存命中、压缩阈值、账单—— 都是按这个单位算的,不是按字数。 讲义讲到「历史太长」之前,必须先把这个单位交代清楚。
为什么同一个问题问两次答案不同:它故意不挑最高分
书里专门讲了这个反直觉的设计:总选最高概率会写出平淡且复读的文本;那个控制随机程度的旋钮取 0.8,是试出来的经验值而非理论所得。 (依据:书 · 这就是ChatGPT(What Is ChatGPT Doing…) §它只是一次添加一个词 —— 生成时故意不总选概率最高的词——总选最高会写出平淡且复读的文本;控制随机程度的温度取 0.8 是试出来的经验值而非理论所得)
这条解释了一个我们在别处见过但没解释的现象: 同一个问题跑两次,一次直接答对、一次点了个不存在的工具(依据:本库摘录 · dong-shou-zuo-ai-agent)。
不是它有时候聪明有时候笨,是它每一步都在带随机地挑。 这直接决定了本课题的一条工程态度:任何靠「它一般会这么做」建立的假设都不可靠, 能用参数硬约束的就别靠提示词说服(依据:本库摘录 · beeai-framework)。
为什么这套东西能行:一个被明确标注为推测的答案
书的核心主张:语言在根本上比它看起来更简单——简单的不是模型,是语言。训练做的事是「隐含地发现」了这些规律,不是被教会了规则。 (依据:书 · 这就是ChatGPT(What Is ChatGPT Doing…) §真正让ChatGPT发挥作用的是什么 —— 书的核心主张是「语言在根本上比它看起来更简单」,模型在训练中「隐含地发现」了使这一切成为可能的语言与思维规律;这些规律只存在于权重里,没有人能读出来)
书还主动堵死了一条太容易的解释:不能用「复杂的行为自己冒出来了」来搪塞——它用的这种网络恰恰是被特意构建来压制那种现象的。
拆解文档在这里标了一条我们要继承的限定:这是推测,不是结论。 书里没有给出任何形式化结果,也没有给出可检验的预言; 而且作者本人用的措辞(「我强烈怀疑」「至少就我们目前所知」)比多数转述都保守。
讲义讲到这一段时必须保留这个限定——不能把「它为什么能行」讲成已经有答案了。
它没回答什么
- 工程落地——部署、成本、延迟、评测,全书不谈。
- agent 本身——工具调用、多轮任务、长期记忆,一句没有。
- 出版之后的进展——对齐方法、推理模型、多模态都在它之后。
- 「语义语法」只有主张,没有形式化结果。
坑与代价
- 书里的具体参数量(1750 亿)是当时那一代的事实,今天已过时。 引用时要说清楚这是哪一年的数。
- 它是一本讲原理的小书,不给任何可运行的东西。 它在本课题里的位置是「地基」,不是「做 法」。
- 中文版导读序的转述比作者本人笃定。 拆解文档专门提醒要区分谁在说话。
判断(无锚): 讲义引用这本书时,只引作者的原话与拆解文档核过的事实,不引导读序。 如果错,会错在: 如果导读序里有作者本人认可的补充说明(比如作者为中文版专门写的),那它就不算转述,可以引。这一点本轮没核。