一本书读懂大模型 — 全书拆解
30 秒导读: 这是一本 15 万字的产业读物,由中国电信研究院天翼智库的大模型研究团队写于 2024 年年中。
先说清它不是什么: 它不是讲原理的书。它讲「ChatGPT 是怎么造出来的」那部分只够入门, 想搞懂机制别看它。 (这一行里说的模型——就是「一台从海量数据里学出规律、再拿这规律干活的程序」; 「大」说的是它内部可以拧的数多到千亿级。)
它真正不可替代的是: 一份把整门生意串起来的中国视角快照—— 造一个模型要花多少钱、这笔钱怎么算、哪些行业真的在买、卖出去的钱最后进了谁的口袋、政府打算怎么管。 这些内容在讲原理的书里一个字都没有。
本组文档是我们重写的完整拆解,八章。读完不必看原书。
1. 先交代清楚:这是谁在什么时候写的
| 作者 | 中国电信研究院天翼智库大模型研究团队——一个国有电信运营商的研究机构,不是高校、也不是做模型的公司1 |
| 成书时间 | 2024 年年中。推荐序署 2024 年 5 月;书里的统计数字大多截到 2024 年 3 月底2 |
| 内容 | 八章,从 AI 的来历、核心技术、要用到的设备,一路讲到行业落地、这门生意的结构、监管与展望3 |
| 自称的特色 | 跨学科——技术、商业、产业、政策、监管五个面一起讲,面向没有技术背景的读者4 |
三件事必须先说,否则会误读这本书:
第一,它是一份 2024 年年中的快照,不是教材
书里的数字有明确的保质期。先认一个名字: ChatGPT 背后那个模型系列叫 GPT, 第几代就在后面缀个数字——GPT-4 是第四代,GPT-3 是第三代,下面那张表里两个都会用到。
还有一道手续也得先说: 一个模型在我国要面向公众开张, 得先向监管部门登记、审核通过才行,这道手续叫备案。
于是书里这几个数是这样的,每个后面都得配一个可比的量才读得出分量5:
| 书里的数 | 拿什么比 |
|---|---|
| GPT-4 的参数(模型内部那一大堆可以拧的数,数量越多个头越大)「超过 1 万亿」 | 它的上一代 GPT-3 是 1750 亿,两代之间翻了五倍以上 |
| 国内完成备案的大模型「117 个」 | 书里另一处说 10 亿参数以上的模型有 100 多个——也就是说,做出来的模型几乎都去备了案 |
| 面向具体行业做的大模型「341 个」 | 是上一行那 117 个的近三倍——这一行真正的量在行业那一侧,不在通用模型那一侧 |
这三个数都是当时数出来的存量。
判据只有一条:凡是带「截至某年某月」的句子,今天都只能当史料读; 凡是讲「为什么只能这么做」的段落,今天仍然有效。
而且成书的时间点很特殊:它写在「会先想一会儿再回答」的那一类模型出现之前。 2024 年 9 月之后出现的这类模型,以及它引发的整个行业重新算账,全书一个字都不可能提到。
第二,作者是这门生意里的直接参与方,而且是国有企业
这一点不点破,书里很多段落会被误读成中立分析。
中国 电信自己就是大模型玩家:书里出现的星辰大模型、启明网络大模型、天翼云慧聚平台、 上海临港的万卡机房、中部与京津冀两个专门堆芯片的机房(这种专门堆 AI 芯片的机房行话叫智算中心; 算力指的是一堆芯片在单位时间里能做多少次运算),都是作者所在企业的产品6。
推荐序更是直接写明中国电信要做「智能算力的主要服务商、基础通用大模型的先行者、行业大模型的主导者」7。
这会往哪个方向偏,是可以预判的:
| 书里的倾向 | 和作者位置的关系 |
|---|---|
| 大量篇幅论证机房和芯片这一层是决定因素 | 电信运营商正是建机房、卖算力的那一方 |
| 强调把模型装进客户自己的机房、数据不外流 | 运营商的政企客户正是这类需求的买方 |
| 反复出现政务、工业、医疗这些卖给机构的行业 | 这些是运营商的传统客户盘 |
| 收入预测里机房和芯片这一层拿走 50%–70% | 这个结论对作者所在的一侧最有利 |
这不等于书写错了。 它的论证基本站得住,数据也标了来源。 但读的时候要把**「事实」「第三方预测」「作者的倾向」**三样分开——本拆解全程做了这个区分。
第三,书里有四个声音,必须分开
| 声音 | 出现在哪 | 我们怎么标 |
|---|---|---|
| 正文作者(天翼智库团队) | 全书主体 | 默认 |
| 推荐序作者(邵广禄,2024 年 5 月于北京) | 「推荐序」 | 「这是推荐序作者的说法」 |
| 被引用的第三方(IDC、麦肯锡、Gartner、信通院、亿欧、智研瞻、罗兰贝格……都是市场调研或咨询公司) | 遍布全书,尤其行业与产业两章 | 「这是某机构的预测,不是作者的判断」 |
| 我们 | —— | 判断块 |
第三个声音是这本书最需要警惕的地方。 书里大量结论性的数字—— 「2030 年政务大模型市场 6612.78 亿元」「AI 将为全球经济带来 35.6 万亿美元」—— 都是咨询公司的预测,不是已经发生的事实,而书里往往和事实并排陈述,不加区分。
2. 全书一条主线(读完这一节,你就懂了这本书)
这本书表面是八个独立主题,底下是一条从「东西怎么造出来」走到「这门生意怎么做」的链子。 下面把它完整走一遍——不看后面任何一章,只读这一节,你也能把这本书讲给 别人听。
细节全部留给对应章节,这里只讲「发生了什么、为什么只能这样」。
① 它先给整个行业画了一条时间轴
这本书讲的东西叫大模型——就是 ChatGPT、文心一言这类你输一句话、它回你一段话的程序 (英文缩写 LLM,即 large language model,直译叫「大语言模型」)。 书没有一上来讲它怎么造,而是先给整个人工智能行业画了一条时间轴:
只会照人写死的规矩办事 → 能看能听能说 → 能理解会推理 → 能自己定目标、自己干完
图说:这条轴量的是「机器表现得多像人」,不是「用了什么技术」。
书说我们现在站在第三格,第四格「尚未在实际中应用」。
这条轴是全书的坐标系,后面七章都往它上面挂。 但它同时是全书最不该照抄的一段——这一章的史实错误最 密集,第 01 章会逐条点出来。
② 让第三格成立的不是一个发明,是一串补漏
最容易犯的错,是以为大模型靠的是某一项突破。不是。
书把它拆成五样东西,而这五样是一个接一个被逼出来的: 先有一种新造法让机器读长文章不再丢三落四、而且能同时开动上万块芯片一起算; 造出来的东西什么都懂一点、什么都不精,于是要再调一遍;
调完它会说话了,但说的不一定是人想听的,于是要请人来打分; 打完分它听话了,但个头太大跑不动,于是要瘦身; 瘦下来跑起来了,但什么都往外说,于是要加约束。
每一样都是在补上一样留下的窟窿。中间断一环,后面全部落空。(怎么补的,第 02 章讲。)
③ 这五样东西全都要烧钱,而这笔钱是可以算出来的
这是全书最有价值的一段,也是它区别于所有科普书的地方。
书从「机器学习——让机器自己从数据里找规律,而不是人把规则写死——到底在做什么运算」 推出两条极简的算式, 让你能拿一个模型的规模、一天多少人来用、每人一天问答几次, 十分钟估出它需要多少张显卡、要烧多少电。
算出来的结果有一个反直觉的地方:
训练(把一个模型从数据里练出来的那个过程)只花一次钱, 而上线之后每天回答问题的开销,比训练还大得多。
书举的那道题里,训练要六千多张顶级显卡跑一天,上线之后每天要一万三千多张显卡不停地转8。
这条结论直接决定了后面所有的生意判断。(算式长什么样、怎么用,第 04 章讲。)
④ 钱花下去还不够,还得有电、有地方放、有数据
顺着钱往下推,一路推出四堵墙:
一张显卡不够 → 得成千上万张一起干 → 它们之间来回传数据反而成了新瓶颈
→ 这么多机器得有地方放,还得散热 → 风扇吹不动了,只能泡到液体里降温
→ 最后卡在电费上:马斯克说两年内会从「缺芯片」变成「缺电」[^9]
图说:每一堵墙都是被上一堵推出来的,不是有人事先规划的。
而另一头的数据更紧张:能拿来喂给机器读的高质量文字,快用完了。 书引的预测是 2026 年就见底9。 于是这一行开始做一件听起来很怪的事——用机器造出来的假数据,去训下一个机器。
⑤ 钱和数据堆出来的本事,书归成四条
看得懂、写得出、想得清、记得住。
四条里最值得带走的是最后一条,因为它解释了那个所有人都遇到过的毛病: 它会一本正经地编。
书说得很到位:这些知识不是像文件一样存在硬盘里,而是被压进了上千亿个数之间的计算关系。 而压缩会丢东西,先丢的永远是罕见的那些——一个页码、一个人名、一条法条的编号。
丢掉之后,它并不知道自己丢了什么。 它手上永远有一张「下一个字最可能是什么」的清单,清单上永远有分数最高的那一项 (这个「有多大可能」行话叫概率),所以它永远答得出来,而且答得读着通顺。
于是编造不是它坏了,是这套存取方式的必然产物——书明确说这无法完全避免10。
(这四条各自是什么、这三级台阶各自凭什么,第 05 章讲。)
⑥ 本事要变成产品,先看人和机器谁做主
书给了一条特别好用的分法——不按产品长什么样分,按机器承担多少活儿分11:
| 谁做主 | 什么样 |
|---|---|
| 人做主 | 你说一句,它做一件。它是个听话的工具 |
| 五五开 | 它是个有想法的搭档,你写它改,它写你改 |
| 它做主 | 你只给一个目标,剩下的它自己拆、自己干、你验收 |
顺着这条轴往前一步,书押了一个很大的注: 大模型会取代搜索引擎(那种按关键词给你一串网址的东西),成为人们上网的第一个入口。 理由是它把「一个个点开链接看」和「自己把几个网页拼起来」这两步替用户做掉了12。
但这一脚会踩碎搜索引擎的饭碗: 它的界面上没有一排排的结果,按出价排名卖广告这套机制在结构上就不存在了; 而回答一次问题的成本,比搜一次贵一个数量级13。(第 05 章讲透。)
⑦ 到了行业里,五个行业其实在做同一件事
书用五章分别讲了五个行业,但骨架完全一样。 真正的差别只有一条:这件事错了要不要紧。
错了没关系 ─────────────────────────────→ 错了出人命 / 赔大钱
客服、写稿、查资料 整理、分析、给建议 看病、放贷、控制机床
已经用上了 正在试 老办法还得 留着
图说:大模型先吃掉「错了没关系」的活儿,精确的活儿仍然交给老办法。
工业那一章讲得最实在:新旧两种做法会长期共存,因为听声音判断机器故障、 看画面挑次品这类活儿,老办法至今更好用14。(第 06 章讲。)
⑧ 这门生意分三层,而钱会往两头走
上游是芯片和机房,中间是做模型的,下游是做产品的。书给了一份收入分配的推测15:
芯片和机房这一层拿 50%–70% · 做产品的拿 30%–40% · 做模型的拿 0%–10%。
做模型本身几乎不赚钱,因为打价格战避不开——书直接算出当时的定价已经贴着成本。
由此推出全书对中国市场最硬的一条判断: 「百模大战」的下半场会从「秀本事」转向「换成钱」,模型的数量会急剧减少。 书引李彦宏那句话来收尾:「我们需要 100 万量级的 AI 原生应用,但不需要 100 个大模型。」16
⑨ 最后是「别出事」这一侧
书列了四类祸:数据泄密和有害内容、版权、伦理、饭碗与公共安全17。
各国的思路出奇一致——尽量少设门槛,把力气放在事中和事后; 方式上「边发展边治理、边摸索边修正」; 抓手是请第三方来考它,看它到底有多大本事、有多少风险18。
⑩ 全书的落点
一句话:
技术这一关已经过了,接下来决定成败的不是模型有多聪明, 而是电费够不够便宜、数据能不能用、行业愿不愿意买、监管允不允许。
这就是这本书和所有讲原理的书最大的分歧点,也是它唯一不可替代的地方。
3. 八章地图
这张表不用记任何术语——每一章后面写的是「读完你能回答什么问题」。
| 章 | 读完你就能回答 |
|---|---|
| 01 那把尺子 | 满天飞的「AI 几点零」是谁定的、按什么分的?这一章还告诉你这本书哪几句话不能照抄 |
| 02 五样东西 | ChatGPT 这类东西是怎么一步步造出来的?为什么少一步都不行? |
| 03 下一步 | 2024 年这行的人押注什么?两年过去,押中了哪些、押空了哪些? |
| 04 账本 | 一个模型要多少张显卡、烧多少电?这笔账怎么自己算一遍? 数据快不够用了怎么办? |
| 05 本事与产品 | 它为什么写得了文章却算错数、还会编?这些本事怎么变成你手机里的东西? |
| 06 行业剧本 | 医院、电视台、银行、政府、工厂上大模型,哪一步最容易卡住?为什么老办法还不能扔? |
| 07 钱的流向 | 这门生意的钱最后进了谁的口袋?为什么做模型的那一层几乎不赚钱? |
| 08 祸与管 | 它会闯什么祸?各国政府打算怎么管?管得住吗? |
推荐顺序: 01 → 02 → 04 → 05 → 06 → 07 → 08,03 可以最后读。 只想拿结论的话: 读本页第 2 节,加 04、07 两章就够——那两章是这本书唯一别处不太找得到的东西。
4. 这本书覆盖什么、不覆盖什么
覆盖(而且是同类书里少见的):
- 一份完整的中国大模型行业快照:哪些公司在做、散落在哪些城市、备案了多少个、怎么部署、政府在招什么标;
- 一套能自己重算一遍的成本测算:从最基本的运算次数推到算式,再推到具体的显卡张数与电费;
- 数据从哪来的四个环节:去哪儿采、怎么加工、不够了怎么造、模型不知道的事怎么临时喂给它;
- 五个行业的落地细节:医疗、媒体、金融、政务、工业,场景拆得很细,案例都是实名的;
- 这门生意分几层、钱怎么分,以及「把模型当成水电一样按用量卖」这套模式的来龙去脉;
- 中外监管思路的对照:欧盟的法案、美国的行政令、我国的暂行办法,以及「软硬两手」的整体思路。
不覆盖(别指望在这本里找):
| 缺什么 | 说明 |
|---|---|
| 像样的原理讲解 | 只讲了个大概。想搞懂机制,这本书不够用 |
| 模型的个头和喂给它的数据量该怎么配 | 全书只强调「个头越大越强」,没有一处提到数据量要跟着一起放大——这是最要紧的一处缺口 |
| 会先想一会儿再回答的那类模型 | 写在 2024 年中,而那类模型是同年 9 月之后的事 |
| 让模型自己干活的工程现实 | 讲了愿景和案例,但「它怎么调外部工具」「多步任务怎么保证不出错」一个字没有 |
| 公开可下载的模型生态 | 只说了「公开的和不公开的会长期并存」,没有具体家族、授权条款、社区这些实际信息 |
| 失败案例 | 全书几乎只有成功案例。没有一个「上了大模型然后效果不行」的记录 |
5. 今天读,要修正的五处
这本书写于 2024 年年中。 下面五处不是它写错了,而是它没跟上、或者当时就搞错了。 每一条凭什么这么说——哪一篇论文、谁写的、哪一天发的——都在对应的章节里写着, 这里只说「要改什么」。
| 书里怎么说 | 今天该怎么改 | 详见 |
|---|---|---|
| 模型个头每年至少长 10 倍 | 补一句:个头和喂给它的字数必须一起放大。这本书出版前两年就有人指出,当时的大模型普 遍「个头太大、读的字太少」。全书没有一处提到这件事,这是它最大的技术缺口 | 第 04 章 |
| 「个头长到某一步,它就突然会了一样谁也没教过的本事」被当成既定事实 | 这件事有争议:换一种打分方式,那个「突然」就不见了。当描述用没问题,当解释用是空的 | 第 05 章 |
| 「让它把中间步骤写出来」只是一种提问技巧 | 方向对,但它已经从提问技巧变成了训练目标——现在是训出来的习惯,不必再靠提问诱导,小的模型也能被训出来 | 第 05 章 |
| 「临时喂资料」这套做法没给名字 | 步骤书讲对了,但它早就有正式名字,而且那篇论文比这本书早四年。拿不到这个名字,读者就搜不到后面四年的全部研究 | 第 04 章 |
| 美国的监管靠拜登那道行政令 | 已经作废:那道令在 2025 年 1 月被撤销,换成了一道方向相反的。书说美国治理体系「逐步成熟」,而它依据的东西已经不存在了 | 第 08 章 |
判断(我们的,不是书里的): 这五条里,前两条最要命,因为它们不是「过时」,是当时就该知道。 讲「个头太大、读的字太少」那篇比本书早两年,质疑「突然就会了」那篇早一年,两篇都是当年的热门工作。 这说明这本书的取材方式是「综述产业动态」,不是「梳理研究前沿」—— 它读的是咨询报告和新闻,不是论文。 如果错,会错在: 如果作者是有意省略(比如认为对非技术读者没必要), 那这是取舍不是疏漏——但书里没有交代,我们无从判断。
6. 我们的判断
判断(我们的,不是书里的): 这本书今天的价值排序是—— ① 这门生意的结构和算账方式(仍然有效) > ② 2024 年的行业快照(史料价值) > ③ 技术原理讲解(直接跳过)。 引用它的时候引①和②,技术定义千万别引——第 01 章里就有若干处硬伤。 如果错,会错在: 如果这门生意的结构本身发生了质变(比如回答一次问题的成本降到某个临界点, 让芯片和机房不再是最贵的一环),那①里的收入分配判断也要跟着修正。 判据是:同样一次问答,今天「上线之后每天的开销」还是不是占大头。
判断(我们的,不是书里的): 全书最该带走的一件事,是它把「算力」从一个形容词变回了一个可以算的数。 书给的那两条算式,配上「一天多少人用、每人问答几次」, 十分钟就能估出一个产品要多少张卡、烧多少电。这个习惯比书里任何一个结论都值钱。 如果错,会错在: 这两条算式只覆盖了最主要的那部分运算, 漏掉了「句子越长、开销涨得越快」的那一块。 句子很长的时候(长文档、长对话),实际成本会明显高于估算——估出来的是下限,不是实际值。
判断(我们的,不是书里的): 读这本书要一路盯着「这句话是谁说的」。 全书大量结论性数字来自咨询公司的预测(IDC、麦肯锡、Gartner、亿欧、智研瞻、罗兰贝格……), 而书里把它们和已经发生的事实并排陈述,不加区分。 我们的拆解里 凡是这类数字都单独标了出处机构和「这是预测」。 如果错,会错在: 如果把这些预测当成作者的判断去引用, 就会把一份产业综述读成一份行业承诺——那是这本书最容易被误用的地方。
判断(我们的,不是书里的): 这本书没有一个失败案例,这件事本身就是信息。 五个行业章节里每一个案例都是「效率提升 X%、成本下降 Y%」,数字全部来自厂商官宣。 一份 2024 年的产业报告里没有任何「试了但没成」的记录,只能说明它的取材来自宣传口径。 如果错,会错在: 如果这本书的定位本来就是「向产业界和决策者介绍机会」而非「评估风险」, 那这是体例问题不是诚信问题——但它的书名和自我定位是「全面、客观、深入」,那就该有反面材料。
7. 兑现表:每一处「后面讲」都记在这里
这份拆解里凡是往后指的话——「第 N 章讲」「后面会讲」「见第 N 节」——都在下表记一行。 逐行核过两件事:那一节真的讲了吗?讲的是不是许诺的那件事,而不是同名的另一件事。 这张表是拿来核对的,不是拿来读的——右边一列写到节为止,不必现在弄懂它讲的是什么。