动手学大语言模型 —— 全书拆解
先把书名里那个词讲掉。大语言模型(英文 large language model,常用缩写 LLM——本文两种写法都会出现) 就是一台读了海量文字、学会「接着往下写」的机器。 「大」指的是它内部可调的数值多——几十亿到几千亿个。
30 秒导读: 这是一本 2024 年的实操书,回答一个问题—— 今天「AI 会说话」这件事,是由哪些零件拼起来的,每个零件解决什么麻烦。
本文后面提到这台机器,一律用中文全称,或者直接简称模型——说的是同一样东西。
它的长处不在深,在全:从最土的办法一直讲到最新的省钱训练法,中间一环不落。
而它真正值得带走的,是两条藏在结构里、书自己都没点明的判断: ① 所有能力都建立在同一件事上——把文字变成数; ② 遇到新任务,先假设你不需要训练任何东西。
本组文档是我们重写的完整拆解,九章。读完不必看原书。