跳到主要内容

课程一 · 基础课程

这门课程管什么: 把一个对 AI 一无所知的人,带到「能看懂别人在说什么、能自己判断一个说法靠不靠谱」。

不带到「能自己推导」。 那是后面课程的事。

这门课程在哪一程

现在 ─→ 课程一:基础课程 ← 你在这里

中期 ─→ 课程二…N:定向补课 发现自己哪儿虚,就开一门

终态 ─→ 专题深入研究 融会贯通之后,才谈得上「我要研究什么」

课表

进来时以为出去时知道
1 · 一个程序怎么学会东西AI 是被人写死规则的程序,聪明是程序员一条条写进去的它里面没有规则,只有几十亿个可调的数。训练就是:拿标准答案量它错了多少,再顺着这个错反推每个数该往哪边挪一点点,挪几万亿次
2 · 文字怎么变成数它读得懂文字它一个字都没见过。文字先被切成 token,每个 token 换成一长串数;意思相近的串在这个空间里靠得近。它从头到尾算的都是数
3 · 它是怎么造出来的大模型是一整个巨大的程序它是一叠结构相同的层,层里最核心的是注意力。造它分几步:洗数据 → 拿海量文本预训练 → 用示范样本微调 → 用人的偏好再训一轮。MoE 是让这叠层里大部分数在每次计算时不参与,省算力
4 · 怎么让它替你干活它能自己上网、自己算、自己动手它只会往下写字。所谓 agent 是外面那一圈代码:它写出「我要调 X」,你的代码真去调,再把结果贴回去让它接着写。循环、什么时候停、跑偏了怎么办、历史摆在哪——全在这圈代码里
5 · 怎么做研究本身实验就是跑一遍看结果单次跑测是噪声。要比较就只动一处、其余固定、每个变体跑三遍;记不清代码版本和题目指纹的数据等于没有;做失败的实验和做成的一样值钱

每一行的两头是同一件事,那一课就不该存在。

每一课都走同样的五步

① 学 -------> ② 调 -------> ③ 做 -------> ④ 破 -------> ⑤ 写
讲透基础 各家怎么做 规规矩矩 发散性实验 我们自己的论文
做个 demo

lessons/ survey/ _lab/ _lab/results/ paper.md
map.md prototypes/

调研、demo、实验、论文都挂在教学底下,是教学的一部分,不是平级的东西。

顺序

1 → 2 → 3 是一条直线,不能跳。 第 2 课要用第 1 课的「一个数怎么被调」, 第 3 课要用第 2 课的「一段文字变成了什么」。

第 4 课可以在第 3 课之前先读一遍——它讲的是外面那圈代码,不依赖里面怎么算的。 但要判断「模型为什么会在这儿跑偏」,还是得回来补 1–3。

第 5 课贯穿全程:从第 1 课起就在用它的规矩做实验,到第 5 课才把这些规矩讲成一课。

这门课程算不算上完

五课各自都满足这五条:

  1. 不看资料能把这一课讲给别人听;
  2. 亲手跑过 demo,改过其中一处、看到了变化;
  3. 汇总研究里各家分歧和我们的取舍写清楚了;
  4. 发散性实验做过,包括做失败的;
  5. 有一篇拿得出去的论文。