第 1 课 · 它其实只会接着往下写字
读这一课前你需要会什么:什么都不需要。 你不需要知道什么是编程、什么是神经网络、什么是训练。 出现的每一个新词都会当场用大白话讲清。讲不清楚的地方就是我的问题,请直接标出来。
这一课结束时你会
- 说得出你打字给 AI 时,它那一头到底在重复什么动作;
- 说得出它为什么会一本正经地胡说——而且知道那不是故障;
- 说得出为什么「让它记住刚才说过的话」这件事,必须由我们写代码来做,它自己做不到。
第 3 条是这整个课题存在的原因。这一课把它讲清楚,后面五课才有地方挂。
1. 先看你已经见过的现象
你跟 AI 说一句话,它的回答不是「唰」一下整段出现的,是一个字一个字往外冒的。
大多数人把这当成一种动画效果——像打字机那样,做出来好看而已。
它不是效果。那就是它真实的工作节奏。
这一课要讲的所有事,都是基于这个现象形成的。
先把「它」这个词定下来
后面全文管它叫大模型。
大模型是一个程序。 你给它一段文字,它给你还回来一段文字。它只干这一件事。
它不会上网、不会读你的文件、不会记事、不会打电话。 你听说过的那些「AI 帮我订了机票」「AI 帮我改了代码」,干活的都不是它,是外面另外写的程序。 那些程序长什么样,是第 3 课往后的内容。
「大模型」这个名字里的「大」指的是它内部可调的数特别多。 具体多到什么程度,以及那些数是干嘛的,这一课不需要知道,第 2 课再说。
2. 顶层全景:它在重复一个动作
一句话:它反复回答同一个问题——「照目前这段文字,下一个该写什么?」
你给它一段文字
│
▼
┌──────────────────────────────┐
│ 从头到尾读一遍这段文字 │
│ 算出:下一个该写什么 │ ←─┐
│ 写上去 │ │
└──────────────┬───────────────┘ │
│ │
└─── 文字变长了 ──────┘
从头再来一遍
图说:每转一圈只多出一点点文字。转几百圈,就是你看到的那一整段回答。
注意那条往回指的箭头——它回到的是「从头读一遍」,
不是「接着刚才想的地方继续」。
这里有一件事必须现在就说清楚,因为后面五课全靠它:
每转一圈,它都是从头把整段文字重读一遍。 上一圈想了什么、算过什么, 转完就丢了,一点都不留。
它没有「刚才」。
为什么它能听懂一整句话、还能照办——那是第 2 课的事。 这一课只管一件事:它是怎么一个字一个字把话写出来的。
3. 主走查:一句话,从头走到尾
这一节我们盯着一个具体的句子,走完全程。 后面每一节都会回到它。
你在对话框里打了这么一句,按下回车:
北京今天天气怎么样?
第 1 圈
它读到的不只是你这一句。真正送到它面前的是这样一段文字:
系统:你是一个乐于助人的助手。
用户:北京今天天气怎么样?
助手:
注意最后一行——「助手:」后面是空的。 这就是留给它的位置。 它要做的事只有一件:接着这个冒号往下写。
它算出一张单子,大意是这样(下面这些百分比是我为了讲清楚编的,不是真实数值):
| 下一个可能写什么 | 可能性 |
|---|---|
| 我 | 32% |
| 抱 | 25% |
| 北 | 18% |
| 目 | 9% |
| …… | …… |
它挑了「我」,写上去。