行业剧本 — 医院、电视台、银行、政府、工厂在做同一件事
这一章讲三件事: 一个「行业大模型」是怎么造出来的; 五个行业各自把它用在哪儿、为什么是那几个环节; 以及这五章几十个案例有一个共同的毛病,读之前必须先知道。 第 05 章讲的是「本事怎么变成产品」,这一章讲「谁在花钱买」—— 而钱从哪儿来、最后进谁口袋,第 07 章讲。
1. 先看现象:每个行业都说自己「上了大模型」
翻开任何一份行业报告,都会看到同一句话:这个行业「已经上了大模型」。 医院这么说,电视台这么说,银行、政府和工厂也这么说。
问题是:上的是同一样东西吗?各自上在哪一步?
书用了五章分别讲这五个行业,每一章的骨架完全一样: 产业图谱 → 典型场景 → 实名案例 → 市场预测 → 发展趋势。
这种整齐本身就是信息:它说明这五个行业做的其实是同一件事。 这一章先把那件事讲清楚,再讲五个行业各自的差别在哪。
2. 顶层全景:一份共用的剧本
拿一个通用大模型当底子
└─ 灌进这个行业的语料,再训一遍 ← 三步法,第 3 节
└─ 挑一种部署方式(看数据能不能出门) ← 三种部署,第 4 节
└─ 先上「错了没关系」的环节,再往「错了要紧」的环节推 ← 第 5 节
└─ 精确活儿留给老办法,两套长期共存 ← 第 6 节工业那一段讲得最透
图说:五个行业走的都是这条路。差别只在最后两步走到了哪一格。
一条贯穿全章的主走查:一次门诊
这一章的每个承重机制,都会回到这一次门诊上占一步。 下面的病情、字段和数值都是为演示编的,不是某次真实门诊的记录。
输入(患者的原话): 「我这两天右下腹疼,昨天开始有点低烧,不想吃东西。」
| 走到哪一步 | 这次门诊里它到底吐出什么 | 谁在这一步兜底 |
|---|---|---|
| ① 智能导诊 | 「建议挂普通外科,可能与阑尾有关;先做血常规 + 腹部超声。」 | 挂号窗口的人。挂错了,重挂一次 |
| ② 预问诊 | 记下四条:疼痛部位=右下腹;起病时间=2 天前;伴随症状=低烧、食欲下降;既往史=无 | 医生进诊室时会当面复核一遍 |
| ③ 病历结构化 | 把上面那段口语变成四个格子:主诉 / 现病史 / 既往史 / 初步诊断,每个格子都是能进数据库的一行 | 医生签字的那一步 |
| ④ 开药下医嘱 | —— | 书里一个案例都没有 |
四步里,前三步的产出全是文字,而且下一步一定有一个人看一眼。 第四步没有人在中间拦,所以它在这本书里是空的——这正是第 5 节那条判据。
这一章后面每一节,都会回到这次门诊上: 第 3 节看这三步是怎么造出来的、第 4 节看那句原话为什么不能出医院的门、 第 5 节看这条链为什么只能从①往④推、第 6 节看别的四个行业各自的第①步长什么样。
一组当时的存量数字(截至 2024 年 3 月 30 日)1:
| 国内已发布的行业大模型 | 341 个 |
| 其中基于自家通用大模型做的 | 87 个(百度、华为、阿里、科大讯飞、中国移动、中国电信) |
| 其余大多基于什么 | 别人公开的基座模型(GLM 系列、百川、通义千问,以及国外的 Llama) |
| 集中在哪三个行业 | 医疗健康(57 个)、金融(35 个)、传媒游戏(27 个),合计 42.2% |
| 集中在哪些地方 | 北京 121 个(35.5%),广东 52、上海 47、浙江 282 |
为什么恰好是那三个行业: 书给的理由站得住—— 它们都是「靠知识挣钱」的行业,而且本来数字化程度就高3。 知识密集意味着有活儿可干,数字化程度高意味着有数据可用。
但这张表里有一个数按不出来,得当场点破
拿计算器按一下:57 + 35 + 27 = 119,除以 341 只有 34.9%,不是 42.2%。
回原文核对过了。书给的分项占比是医疗健康 20%、金融 12.5%、传媒游戏 9.7%, 三个加起来正好 42.2%——但反推分母:57 ÷ 20% = 285,不是 3413。 这三个百分比的分母另有其数,而书把它和「341 个」并排摆在同一段里。
同一段里的另一组百分比反而是对的: 北京 121 个占 35.5%,121 ÷ 341 = 35.5%, 分母确实是 341。所以不是读者看错了,是书自己的两组百分比用了两个不一样的分母。
判断(我们的,不是书里的): 这一处和第 04 章那两处「万亿错位」是同一类毛病, 但性质轻一些——它不改变这一章的任何结论(三个行业最集中这件事没有变), 只影响你能不能拿这几个百分比去接着算别的。 实用推论:引「哪三个行业最多、各多少个」可以,引「42.2%」不行——你不知道它的分母是什么。 如果错,会错在: 如果那 341 个里有一部分归不进任何行业、被排除在行业占比之外 (比如有五十几个是跨行业或未标注的),那两个分母就都是对的,只是书没交代口径。 但书里没有这句交代,读者无从判断——这正是问题所在。
3. 剧本第一步:一个行业大模型是怎么造出来的
这一节回答:「行业大模型」和「通用大模型」到底差在哪。
书给的定义很干脆:行业大模型就是拿通用基础模型当底子, 结合某个行业的专业知识、专家经验和生产数据,再做专项训练得到的模型4。
三步走4:
| 步 | 干什么 | 真正卡在哪 |
|---|---|---|
| ① 摸需求、收语料 | 先搞清这个行业怎么说话、知识怎么组织、有哪些数据;然后收集高质量的行业专用语料,做清洗、格式转换、打标签 | 这一步最难,也最贵。第 02 章说过:微调真正的瓶颈不是算法,是拿不到高质量数据 |
| ② 精调与微调 | 在通用模型上按行业需求做定制:调结构、调参数、加行业数据集再训;也可以用私有语料微调,或者外挂私有数据库 | 「外挂私有数据库」就是第 04 章那套检索增强生成,书在这里又提了一次,但仍然没给它名字 |
| ③ 评测与优化 | 评估它够不够用,不够就重训、调参、换策略,或者引入提示词工程 | 书没说「够不够用」的标准是什么——这是全章最大的空白 |
书举的自家例子: 中国电信研究院的「启明」网络大模型, 拿通用开源模型当底子,学通信行业的专业知识,做网络运维5。 这是作者所在企业 的产品,读的时候心里有数。
回到那次门诊,三步各是什么: 第①步是把这家医院过去十年的门诊记录洗成能训的材料—— 光是「右下腹疼」这一种说法,病历上就有「右下腹痛」「右下腹隐痛」「RLQ 疼」十几种写法, 得先统一成一种,这一步最贵; 第②步是拿这批材料在通用基座上再训一遍,让它见到「右下腹疼 + 低烧」就往阑尾那边靠; 第③步是评测——而「导诊准到什么程度才能上线」这个数,书里一个字都没有。
4. 剧本第二步:数据能不能出门,决定了怎么部署
这一节回答:同一个模型,为什么有的客户要买机器、有的客户直接调接口。
| 部署方式 | 模型放在哪 | 谁会选 | 代价 |
|---|---|---|---|
| 私有化部署 | 客户自己的服务器或私有云,或者干脆买一台一体机 | 数据绝对不能出门的:政务、金融、大型企业 | 要投一大笔钱和人力去建、去维护6 |
| 行业云部署 | 由行业里的主导方建一朵云,半公开地供行业内使用 | 行业内中小机构 | 折中方案:安全可控,又比自建便宜 |
| 公有云部署 | 直接调用云厂商的接口 | 中小企业的主流选择 | 最便宜最灵活,但数据要出门 |
书给的两个规模数字:国内超过一半的大模型跑在阿里云上; 百度千帆平台纳管 42 个主流大模型、服务超过 17000 家客户6。
回到那次门诊,这张表只剩一个选项。 患者那句「我这两天右下腹疼」是能认出具体某个人的病情, 它连同姓名、就诊号一起,一步都不能出医院的门—— 所以医疗这一行走的几乎全是第一行:模型装进医院自己的机房,或者干脆买一台一体机搬进来。 公有云那条便宜、灵活,但这次门诊用不上。
判断(我们的,不是书里的): 这张表其实是一条商业模式的分水岭,书没有点破。 私有化部署卖的是「一套系统 + 一堆机器」,一次性收一大笔; 公有云卖的是「按用量计费」,细水长流。 两种收法对应完全不同的公司——第 07 章那三种商业模式,根子就在这张表上。 如果错,会错在: 如果同一家公司两种都做(实际上大厂确实都做), 那这条分水岭就只是产品线的差别,不是公司类型的差别。判据是收入结构里哪一头占大头。
5. 剧本第三步:先上哪儿?看这件事错了要不要紧
这是这一章最值得带走的一条判据,而且书里没有一处明说,是从五章里归纳出来的。
错了没关系 ───────────────────────────────→ 错了出人命 / 赔大钱
客服、写稿、查资料 整理、分析、给建议 看病、放贷、控制机床
已经用上了 正在试 老办法还得留着
图说:这条轴接的是第 05 章那条结论——它一定会编,所以只能靠挑场景来规避。
验证一下:五个行业最先落地的都是什么?
| 行业 | 最先落地的环节 | 是不是「错了没关系」 |
|---|---|---|
| 医疗 | 智能导诊、预问诊、病历整理7 | 是——医生会复核 |
| 媒体 | 选题、找资料、写初稿、审核初筛8 | 是——编辑会复核 |
| 金融 | 投研助手、客服坐席助手、营销文案9 | 是——分析师和坐席会复核 |
| 政务 | 政务问答、公文起草、政策检索10 | 是——公务员会复核 |
| 工业 | 售后客服、企业知识库11 | 是——书自己就说这是「容错率较高的场景」 |
五个行业全部对上。这不是巧合,这就是那条判据。
回到那次门诊,这条轴就是它为什么只能从①走到③: 第①步挂错科,患者多跑一趟窗口; 第②步记漏一条「食欲下降」,医生当面问一句就补回来了; 第③步病历字段填错,签字那一步会被划掉重填; 而第④步一旦开错药,中间没有任何人拦得住。 四步的技术难度其实差不多,差的全是「错了之后谁来拦、多久拦得住」。
书里唯一一处明确点破这件事的,是工业那一章的开头: 「在客服等容错率较高的场景,大模型将首先实现落地; 而在设计、生产等对精确度要求较高的工业核心环节,大模型和小模型将长期共存」12。
6. 五个行业:各自的活儿是怎么被拆开的
下面每个行业讲四样,顺序固定:
- 这个行业的活儿被书拆成了哪几块、为什么只有某几块跑得通;
- 它到底在买什么;
- 书里最实的一个案例;
- 一处该打问号的数字。
第 1 样是这一节的重点。 上一节抽出来的是五个行业共用的那条剧本; 这一节要补的是各家自己的账本——同样一句「上了大模型」, 医院、电视台、银行、政府、工厂各自动的是哪几道工序、为什么偏偏是那几道。
医疗:买的是「把医生从文书里解放出来」
先看这个行业的活儿是怎么被拆开的。 书把医疗拆成三大块,而三块的成熟度差得极远13:
| 场景 | 具体在干什么 | 书自己给的定性 |
|---|---|---|
| ① 医疗服务 | 智能问诊(跟你来回问答好几轮——行话叫多轮对话——初步判断病情、建议挂哪个科、推荐医院和医生)、影像辅助诊断(看胸片这类片子,用对话方式解释,并自动写出影像报告)、智能诊断与预测(把病理、病历、基因数据合在一起分析,给诊断和治疗建议、评估治疗方案、预测发病风险) | 「在商业化应用方面走在前列」——书点名微软、百度、医联 |
| ② 医药研发 | 覆盖新药从发现、临床前研究、临床试验、注册申请到上市后再评价的全过程;真正省时间的是「设计—筛选—优化—验证」这四步 | 有实名案例(就是下面那个 Drug X),但都还在早期 |
| ③ 医疗机器人 | 手术机器人做术中导航、认病灶;康复和陪伴机器人读懂人的意图、手势、语音、情绪 | 书明写「处于初期阶段」 |
为什么只有第一块跑通了? 三块摆在一起,答案很干脆:
① 医疗服务:模型只写字,写完医生当场看一眼 → 错了立刻被拦住,代价是重写一遍
② 医药研发:模型给出候选分子,对不对要等实验室跑完 → 错了几个月后才知道,代价是白烧一轮经费
③ 医疗机器人:模型的判断当场变成机械动作 → 错了没有人来拦,代价直接落在病人身上
图说:三块的差别不在技术难度,在「错了之后,中间还有没有一个人拦得住、拦得及不及时」。
①有,而且立刻;②有,但很晚;③几乎没有。
而且真正跑通的那部分,还要往里再收一层。 就连第①块里,商业化最扎实的也不是最像医生的 「智能诊断」,而是最不起眼的那几样:把医患对话实时记下来、整理成病历、 把自由文本一键变成能做统计的结构化报告7。
一句话:医院买的不是「AI 医生」,是「AI 文书员」。 第 2 节那次门诊的第①到③步,就是这句话的全部内容。 下面四个行业,请留意各自的「第①步」落在哪儿——你会发现是同一类活儿。
- 在买什么: 就是上面那一句——记录、整理、结构化病历7。 商汤的「大医」覆盖 13 个细分场景,其中相当一部分是导诊、预问诊、病历、随访这类文书活儿;
- 最实的案例: 华为云盘古药物分子大模型辅助研发的超级抗菌药 Drug X—— 先导药研发周期从数年缩短到 1 个月,研发成本降低 70%14;
- 要留神的数字: 同一段里还写着「盘古大模型设计的化合物新颖性可以达到 99%」。 「新颖性」没有定义——是「和已知分子都不一样」?那这个数说明不了药效;
- 书押的下一步: 医疗这一行会往多模态融合走(多模态见第 03 章:同时吃进好几种信息,合成一个理解)。 书说当前这类模型主要只吃图像和文字两种,往后要同时吃文本、图像、视频、音频, 还要跨过分子、细胞、组织这些不同的尺度;并称这是通向「通用医疗人工智能」 (一个模型把医疗上的各种活儿都包了)的关键15。 但书在同一节开头先写了一句更实在的:解释性、数据隐私、安全这三个难题至今没解决—— 所以这一条当方向读,别当进度读。
媒体:买的是「产能」
先看这个行业的活儿是怎么被拆开的。 书把媒体的工作流按六个字排开——策、采、编、审、发、运。 六个字听着像口号,拆开就是一条新闻从「想出来」到「送到人眼前」的全过程16:
| 环节 | 全称 | 大模型在这一段具体干什么 |
|---|---|---|
| 策 | 选题策划 | 从社交动态、搜索热词、新闻流里捞热点,自动生成选题建议,盯舆情 |
| 采 | 信息采编 | 自动汇集多个新闻源、从一堆图文音视频里挑出最有价值的片段、实时追踪事件进展 |
| 编 | 内容制作 | 写初稿、起标题、做摘要、图文转视频、生成字幕、自动剪辑 |
| 审 | 内容审核 | 查不合规和敏感内容、拿海量数据库比一遍确认版权状态、给报道里的事实做核查 |
| 发 | 播报分发 | 虚拟主播播新闻;分析各平台用户行为,决定哪条内容什么时候发到哪儿 |
| 运 | 用户运营 | 按兴趣和历史记录推内容、预测用户会不会流失、设计留存方案 |
书统计下来,厂商的研发重心集中在「制」和「审」两个环节8—— 书用的字是「制」,对应上表里的「编」。为什么偏偏是这两段? 三条理由叠在一起:
- 这两段最费人,而且费的是「熟练但重复」的人。 写初稿、起标题、看有没有敏感词—— 量大、标准清楚、人做起来枯燥,正是最值得换掉的那类活儿;
- 这两段的产出是文字和图像,恰好是大模型唯一能直接生产的东西。 而「策」要的是判断力,「发」和「运」要的是渠道和用户数据的权限——这两样大模型给不了;
- 这两段错了都有人兜底。 初稿有编辑改,审核初筛之后还有人工复审——又回到第 5 节那条判据。
反过来看更有意思:「策」和「运」这两头恰恰是媒体自己的看家本领—— 选题眼光和用户关系。厂商既不容易做,媒体也不太愿意交出去。
判断(我们的,不是书里的): 六个环节里被押注的两个,产出全是「可以立刻被人核一遍」的东西。 这解释了为什么媒体行业看起来落地最快——不是它技术门槛低,是它本来就自带审稿流程。 换句话说,大模型进得最顺的行业,是那些早就为「人会出错」建好了复核机制的行业。 如果错,会错在: 如果某个行业没有复核机制却也落地很快(比如纯个人使用的场景), 那这条解释就只对机构客户成立。判据是:落地快的环节是不是都压着一道人工复核。
- 在买什么: 就是上面那两段——「编」和「审」,也就是产能和把关8;
- 最实的案例: 中科闻歌的雅意大模型在红旗融媒体中心落地: 地道外文写作速度提升近 10 倍、真人外语主播成本降低 80%、 首发新闻生产时间节省 80%、资料查阅时间节省 80%17;
- 要留神的: 书自己在同一章里写了三条风险—— 新闻真实性、版权确权、信息茧房18。 这三条和上面那些提效数字来自同一套技术,书把它们分在两节,读的时候要合着看。
第三条要接回第 05 章第 9 节那一段。 那里说的是: 原本由用户完成的信息粗筛,现在被大模型做掉了—— 你不只是看不到别的,而是不再知道「有别的」。 放到媒体这一行,这条的分量加倍:上表「运」那一格干的正是「按兴趣推内容」, 而「编」那一格现在由同一个基座在写。 同一个基座既决定写什么,又决定推给谁看—— 这才是「信息茧房」在媒体行业的确切含义,书只列了名字,没有把这两格连起来。
媒体这一章还有一句判断,值得单独记:书说媒体行业「可能将成为大模型影响最大的行业之一」19。 理由很直接:这个行业的产出就是内容,而内容正是大模型唯一擅长直接生产的东西。
金融:买的是「合规成本」
先看这个行业的活儿是怎么被拆开的。 书列了五个场景。 把它们按「碰不碰钱」重新排一下,这一行的落地顺序立刻就清楚了20:
| 场景 | 具体在干什么 | 碰不碰钱 |
|---|---|---|
| 投研助手 | 整理不同客群的风险偏好、分析市场数据找规律、替分析师做桌面资料研究 | 不碰——产出是给人看的材料 |
| 客服坐席助手 | 事前自动做数据标注(给数据贴上标准答案,好让模型照着学)和知识维护,事中给坐席递前情摘要、自动填工单,事后生成质检用的训练数据 | 不碰 |
| 智能营销 | 更细地切客群、自动写营销文案、给每个用户做个性化内容 | 不碰 |
| 理赔助手 | 自动识别和分类理赔材料、提取文件要点、做初步核定与定损,再交人工二次核查 | 半碰——结论必须走人工复核 |
| 风控合规 | 识别新型欺诈、查合规文件、自动生成合同并标出风险条款 | 直接碰——判错一笔就是真金白银 |
书自己也点了这个顺序: 它说投研「被普遍认为是大模型最有可能首先得到广泛应用的场景」20。 理由和媒体那一段一字不差——投研的产出是文字,而且下游一定有人再看一遍。
还有一个共同点值得单独记:五个场景里有三个的本质是「翻文件」—— 查合规文件、提取理赔材料要点、检索审计制度。 这三样都是「资料在,只是找不到」,而这正是第 04 章那套「临时喂资料」的做法最擅长的一类问题。
- 在买什么: 说到底是合规和文书这两块的人力成本—— 五个场景里真正先掏钱的那三个,产出都是文字9;
- 最实的案例: 浦发银行和百度合作,用「大模型 + 向量数据库」做审计制度检索—— 审计人员靠问答就能查到所需条款21。 这是第 04 章那套「临时喂资料」在金融业最标准的一次落地;
- 要留神的数字: 度小满的风控大模型「可以使银行信贷风险降低 25%」22—— 书自己注明这是「据官方介绍」,也就是厂商自报。 风控效果高度依赖客群和周期,单一厂商自报的降幅没法横向比较。
金融这一章还有一个有分量的存量数字:国内 42 家上市银行的 2023 年半年报里, 已有 28 家提及大模型相关布局,四大国有银行全部提及23。
政务:买的是「口径统一」
先看这个行业的 活儿是怎么被拆开的。 政务这一章的三大场景对着三句口号: 城市治理「一网统管」、政府服务「一网通办」、政府办公「一网协同」10。 三句话念起来像一回事,对应的其实是三类完全不同的活儿,连用户都不是同一群人24:
| 口号 | 谁在用 | 原来卡在哪 | 大模型接的是哪一段 |
|---|---|---|---|
| 一网统管(城市治理) | 管理者——城市的指挥中心 | 指标模板固定、数据靠人工统计容易错漏、资源调不动、舆情反应慢 | 把海量政务数据动态分析出来、盯舆情、给政策建议和决策支持 |
| 一网通办(政府服务) | 办事人——来办事的老百姓和企业 | 找不到服务入口、看不懂流程指引、听不懂专业词;老式问答机器人只会答预设好的问题 | 听懂人话,基于政务知识给准确回答、边问边办的指引、政策检索与解读 |
| 一网协同(政府办公) | 公务员自己 | 公文的写、审、办主要靠人工,效率低还容易出错 | 起草文书和会议纪要、智能填表与审批、跨部门调数据和资源 |
这张表比三句口号有用的地方在于:它把「谁是用户」标了出来。 三类用户是管理者、办事人、公务员——而掏钱的是同一个甲方。
于是政务这一行有一个别处没有的特点:三类活儿里最好落地的是第三类。 写公文、拟纪要、填表——产出是文字,当场有人签字负责,错了立刻看得见。 而第一类「辅助决策」听起来最有价值,却最难验收, 因为没有人说得清「一条政策建议算不算对」——没有验收标准,就没有采购。
- 在买什么: 三类活儿里先掏钱的是公文和口径这一块10;
- 最实的案例: 华为盘古政务大模型在深圳,1 分钟生成 6000 字公文, 3 分钟生成一份活动保障预案初稿25;
- 要留神的数字: 书引智研瞻产业研究院的预测—— 2030 年中国政务大模型市场规模将达到 6612.78 亿元26。 这是一家研究机构的预测,精确到小数点后两位—— 一个七年后的预测给到这个精度,说明的是模型的形式,不是结论的可靠性。
政务这一章还老实写了三条落地难处:场景复杂且保密要求高、 政策严肃且频繁修订带来检索难题、隐私与敏感信息保护不足27。 在一本以看好为基调的书里,这一段的坦白程度算高的。
工业:买的是「先别碰核心」
这一章是五章里写得最好的一章,因为它是唯一一章明确说了「哪里不能用」。 它也是唯一一章把「这个行业的活儿怎么被一层层拆开」写成了两条完整的线索—— 一条往回看(四个阶段),一条往前看(三波次)。两条合起来,正好解释了本章开头那条容错率判据。
往回看:四个阶段,以及工业为什么最难啃
书给工业智能排了一条时间轴28。这条轴上每一段卡住的地方都不一样,值得一格一格看:
| 阶段 | 时间 | 当时卡在哪 | 做出了什么 |
|---|---|---|---|
| ① 萌芽期 | 1960—2015 | 企业信息化能力弱,生产环节的数据根本采不上来 | 只能拿少量数据建模,做出能部分替代工人操作的自动化专家控制系统 |
| ② 感知期(工业「大数据、小知识」) | 2015—2019 | 数据终于汇上来了,但只够用来「看」和「听」 | 深度学习让工业上的看图、听声音准了一大截,挖出一些藏在数据里的关系 |
| ③ 感知增强期(工业「小数据、小知识」) | 2019—2022 | 细分场景太多、各系统数字化水平参差、数据互相隔离,很多场景的数据量根本不够训一个模型 | 用强化学习、GAN、无监督学习(不给标准答案,让它自己在数据里找出结构)这些办法,在「小数据」上凑出「小知识」 |
| ④ 认知提升期(工业「大知识」) | 2023 至今 | —— | 大模型让工业智能第一次有了「认知」这一层 |
这条轴上真正的关键句是:前三个阶段,工业智能干的全都是「提升人的感知能力」—— 替人看、替人听。到第四阶段才开始替人想。28
而工业为什么是「AI 最难落地的领域之一」,书给了三条并列的原因12:
| 原因 | 什么意思 |
|---|---|
| 强烈的多模态需求 | 判断一台机器的状态,得同时看图像、听声音、读一堆仪表参数——只会读文字不够用 |
| 零碎复杂的应用场景 | 一个行业一个样,一条产线一个样,做出来的东西很难复用到下一家 |
| 小规模的烟囱式数据 | 「烟囱式」是说各个业务系统各存各的、彼此不通,像一根根互不相连的烟囱;单看每一根,数据量都不够 |
往前看:三波次,以及为什么落地顺序是倒过来的
书预计工业大模型的红利会分三波放出来。把它和「研发设计 / 管理服务 / 生产制造」 这三大场景对着看,顺序正好是反的——这是这一章最值得记的一处29:
| 波次 | 打的是哪一块 | 具体在干什么 | 为什么排这个位置 |
|---|---|---|---|
| 第一波 | 经营管理 | 智能售后客服、行业知识库、智能预算分析 | 全是文字活儿,错了当场有人看得见,而且完全不碰生产线 |
| 第二波 | 研发设计(非实时) | 把大模型接进工业设计软件,做自动生成式设计;也用在药物研发、结构预测上 | 仍然不实时,错了大不了重来一版;但要接进专业软件,门槛高得多 |
| 第三波 | 生产制造(实时) | 以有实体的智能机器人为主:人机交互、智能调度生产、质量实时监测。这一波要求模型直接跑在产线设备上(端侧),靠的就是第 02 章第 5 节那套压缩 | 实时、有物理后果、错了停线甚至伤人,所以排最后 |
排序的规矩只有一条,和前面四个行业一模一样:错了要不要紧、错了多久才发现。 「研发设计」听起来比「客服」高级得多,但它排在第二波,不是第一波。
一个硬佐证: 信通院统计的全球 79 个工业大模型应用案例里, 75% 用的是语言大模型,只有 15% 是专用或结构化数据的模型; 而最主要的应用场景是问答29。 换句话说,今天工业上真正在用的,还是「说话」这件事——不是「干活」这件事。
- 在买什么: 就是第一波那一格——客服、知识库、预算分析这类文字活儿; 三大场景里落地顺序是倒过来的:先管理服务,再研发设计,最后才是生产制造;
- 最实的案例: 美国 Cadence 的 Allegro X AI 用在芯片板卡设计上—— 手工布板可能要几天,现在缩短到几小时30;
- 一组值得记的普及率数字: 欧洲顶级制造企业的 AI 普及率超过 30%,日本 30%, 美国 28%,中国 11%31。这是全书少见的、对中国不利的对照数字,书照实写了。
而这一章最重要的一句话,是它给整本书打的一个补丁12:
工业大模型和小模型将长期共存。
书给的理由极其具体:基于声纹分析的设备诊断、基于视频分析的质量检测、安全生产—— 这类活儿,传统的小模型至今更好用。
判断(我们的,不是书里的): 这一句应该被提到全书的前面去。 它说的其实是:「大模型能干所有事」是错的,而且错在一个可以说清楚的地方—— 凡是「输入固定、判据明确、要求高准确率」的任务,专用小模型仍然更划算。 回到第 05 章那条:大模型的输出天生不确定,而质检要的恰恰是确定。 如果错,会错在: 如果多模态大模型在声音和视频上追平了专用小模型的准确率与成本, 这条共存结论就会失效。判据是同一条产线上两种做法的误判率和单次成本。
7. 这五章有一个共同的毛病,必须先知道
这是这一章最重要的一节。
五个行业、几十个案例,数字长得都一样:
效率提升 X 倍、成本下降 Y%、准确率提高 Z 个百分点。
而这些数字有三个共同点:
| 共同点 | 后果 |
|---|---|
| 全部来自厂商或案例方自己发布 | 没有第三方复核,也没有可比的基线(基线就是「原来是多少」那个数——不知道原来多少,「提升 10 倍」这句话就没有意义) |
| 没有一个给出统计口径 | 「效率提升 10 倍」——比的是谁?样本多大?测了多久? |
| 一个失败案例都没有 | 五章里没有任何一处记录「上了大模型但效果不行」 |
判断(我们的,不是书里的): 一份 2024 年的行业调研里没有任何失败记录, 只能说明它的取材来自宣传口径,不是实地调研。 这不影响这五章的结构性内容(三步法、三种部署、场景清单、容错率排序)——那些仍然有用; 但它使得所有百分比都不能拿来做横向比较、更不能拿去做商业论证。 实用推论:引用这五章时,引场景和顺序,别引数字。 如果错,会错在: 如果这本书的定位本来就是「向决策者展示机会」, 那只报成功是体例选择,不是诚信问题——但书的自我定位是「全面、客观、深入」,那就该有反面材料。
8. 作者的判断与证据:哪些有依据,哪些是预测
| 档次 | 这一章里的例子 |
|---|---|
| 有明确依据的事实 | 341 个行业大模型的地域与行业分布;42 家上市银行里 28 家提及;各行业已发布的模型数量;中外制造业 AI 普及率对照 |
| 厂商自报 | 全部案例里的效率与成本百分比(Drug X 的 70%、雅意的 80%、度小满的 25%、吉利-百度的 24.37% 等) |
| 咨询机构的预测 | 医疗市场的多组预测、媒体市场 46.3% 的复合增长率(复合增长率就是把好几年的增长折算成「平均每年涨百分之几」,而且是利滚利地算)、政务市场 6612.78 亿元、工业市场 2026 年超 5 亿美元 |
| 作者自己的判断 | 「媒体行业可能将成为大模型影响最大的行业之一」;「工业大模型和小模型将长期共存」;「金融大模型有望率先规模化落地」 |
第四档里最有价值的是第二条(大小模型共存),因为它是唯一一条给出了限制条件的判断。
9. 边界与局限
这一章没覆盖的东西:
- 没有一处讲「怎么判断够不够用」。 三步法里的第三步是评测, 但书没给任何一个行业的验收标准——而这恰恰是采购方最需要的东西;
- 没有讲落地失败的原因。 数据拿不到、口径对不齐、员工不用——这些真实的坑一个没提;
- 没有讲人的问题。 五章里没有一处讨论「用了之后原来那些人怎么办」, 只有第 08 章会从宏观角度碰一下就业冲击;
- 行业之间没有互相印证。 五章各写各的,同一个厂商在不同行业的表现没有横向对照。
已被时间冲刷的部分:
| 书里的说法 | 现在怎么看 |
|---|---|
| 各行业已发布的模型数量(341、71、42、30、21、12) | 纯时点存量,只有史料价值 |
| 各行业的市场规模预测 | 咨询机构的预测,验证期未到,而且原始口径大多不可查 |
| 「行业大模型 = 通用基座 + 行业语料 + 微调」 | 这条结构性结论仍然成立,是这一章最耐用的部分 |
| 「先上容错率高的环节」 | 仍然成立,而且是判断任何 AI 落地方案最快的一把尺 |
10. 可带走的
- 一次门诊就能把整章走完:导诊输出「挂普通外科」→ 预问诊记下四条 → 病历结构化成四个格子 → 医生签字;而「开药下医嘱」那一步书里一个案例都没有,因为中间没人拦得住;
- 五个行业用的是同一套剧本:三步造模型、三种部署、按容错率排队上;
- 行业大模型 = 通用基座 + 行业语料 + 再训一遍,不是重新造一个模型;
- 三步里最难最贵的是第一步(收语料),不是训练;
- 部署方式由「数据能不能出门」决定,而这条同时决定了卖法:一次性卖机器,还是按用量收费;
- 落地顺序的判据只有一条:这件事错了要不要紧——五个行业全部对得上;
- 医疗买的是文书解放,媒体买的是产能,金融买的是合规成本,政务买的是口径统一,工业买的是「先别碰核心」;
- 医疗三大块里只有「医疗 服务」跑通了,分水岭是——错了之后,中间还有没有人拦得住、拦得及不及时;
- 媒体六环节「策、采、编、审、发、运」里,厂商只押「编」和「审」: 产出是文字、最费重复劳动、下游一定有人复核;而「策」和「运」是媒体自己的看家本领,不外包;
- 金融五个场景按「碰不碰钱」排,先掏钱的三个都不碰钱;而且其中三个的本质都是「翻文件」;
- 政务三句口号对应三类不同的用户——一网统管给管理者、一网通办给办事人、一网协同给公务员; 最好落地的是给公务员那一类,因为只有它有验收标准;
- 工业四阶段的关键句是:前三个阶段都在替人「看和听」,到第四阶段才开始替人「想」;
- 工业三波次的顺序和三大场景正好倒过来(经营管理 → 研发设计 → 生产制造)—— 「听起来高级」不等于「先落地」;佐证是全球 79 个工业案例里 75% 用的仍是语言大模型,主场景是问答;
- 工业那一章明说了大模型和小模型会长期共存(声纹诊断、视觉质检老办法更准)—— 这是全书的一个补丁:「大模型能干所有事」是错的,而且错在一个说得清的地方;
- 中国制造业的 AI 普及率 11%,欧美日在 28%–30%——书照实写了这个对自己不利的对照; 但同一章里**「三行业合计 42.2%」这个数按不出来**(57+35+27 除以 341 只有 34.9%),分项占比另有分母;
- 这五章的所有百分比都来自厂商官宣,没有第三方复核、没有统计口径,而且没有一个失败记录—— 实用推论:引场景和顺序,别引数字。
11. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 341 个行业大模型与基座来源 | 5.1 我国大模型行业应用全景 | text/22-ch05-01-5-1.txt:16(搜「国内已发布341个行业大模型」) |
| 地域分布 | 5.1.1 行业大模型地图 | text/22-ch05-01-5-1.txt:27(搜「北京发布的数量多达121个」) |
| 行业分布与集中的理由 | 5.1.1 | text/22-ch05-01-5-1.txt:30(搜「医疗健康、金融和传媒游戏三大行业」) |
| 三步法 | 5.1.2 技术和部署路线 | text/22-ch05-01-5-1.txt:62(搜「构建行业大模型的主要步骤」) |
| 中国电信「启明」 | 5.1.2 | text/22-ch05-01-5-1.txt:74(搜「启明」) |
| 三种部署方式 | 5.1.2 | text/22-ch05-01-5-1.txt:86(搜「私有化部署、行业云部署和公有云部署」) · text/22-ch05-01-5-1.txt:95(搜「超过一半的大模型运行在阿里云上」) |
| 医疗大模型数量与产业图谱 | 5.2.1 医疗大模型产业图谱 | text/23-ch05-02-5-2.txt:27(搜「国内已发布医疗行业大模型71个」) |
| 三大场景与智能问诊 | 5.2.2 三大典型应用场景 | text/23-ch05-02-5-2.txt:56(搜「超过260个典型案例」) · text/23-ch05-02-5-2.txt:65(搜「建议挂号科室」) |
| 三大场景各自的成熟度 | 5.2.2 | text/23-ch05-02-5-2.txt:62(搜「在商业化应用方面走在前列」) · text/23-ch05-02-5-2.txt:95(搜「药物设计、筛选、优化和验证」) · text/23-ch05-02-5-2.txt:107(搜「处于初期阶段」) |
| 商汤「大医」 | 5.2.2 | text/23-ch05-02-5-2.txt:74(搜「大医」) |
| 华为云与 Drug X | 5.2.2 | text/23-ch05-02-5-2.txt:98(搜「Drug X」) |
| 手术机器人 MicroNeuro | 5.2.2 | text/23-ch05-02-5-2.txt:113(搜「MicroNeuro」) |
| 医疗市场预测 | 5.2.3 市场前景 | text/23-ch05-02-5-2.txt:127(搜「MarketsandMarkets」) |
| 医疗大模型的多模态融合方向 | 5.2.4 医疗大模型多模态融合发展 | text/23-ch05-02-5-2.txt:150(搜「模型的解释性」) · text/23-ch05-02-5-2.txt:153(搜「通向通用医疗人工智能的关键」) · text/23-ch05-02-5-2.txt:156(搜「主要处理视觉和语言两种模态」) · text/23-ch05-02-5-2.txt:162(搜「真正的统一」) |
| 媒体大模型数量 | 5.3.1 媒体大模型产业图谱 | text/24-ch05-03-5-3.txt:36(搜「国内媒体行业已正式发布的大模型共计30个」) |
| 六大场景 | 5.3.2 六大典型应用场景 | text/24-ch05-03-5-3.txt:56(搜「策、采、编、审、发、运」) |
| 六个环节各自在干什么 | 5.3.2 | text/24-ch05-03-5-3.txt:62(搜「浏览难、分析难」) · text/24-ch05-03-5-3.txt:74(搜「信息自动化收集、提取和更新」) · text/24-ch05-03-5-3.txt:89(搜「图文转换成视频」) · text/24-ch05-03-5-3.txt:95(搜「解放审核人力」) · text/24-ch05-03-5-3.txt:110(搜「数字人等更互动」) · text/24-ch05-03-5-3.txt:116(搜「向其推送个性化新闻内容」) |
| 中科闻歌雅意的落地数字 | 5.3.2 | text/24-ch05-03-5-3.txt:119(搜「雅意」) |
| 人民网与央视听的案例 | 5.3.2 | text/24-ch05-03-5-3.txt:134(搜「人民网——百度·文心大模型」) · text/24-ch05-03-5-3.txt:140(搜「央视听媒体大模型」) |
| 媒体业的三条风险 | 5.3.3 大模型重塑后的媒体业 | text/24-ch05-03-5-3.txt:166(搜「新闻真实性」) |
| 银行半年报的存量数字 | 5.4 金融大模型 | text/25-ch05-04-5-4.txt:19(搜「28家提及」) |
| 金融大模型数量 | 5.4.1 金融大模型产业图谱 | text/25-ch05-04-5-4.txt:33(搜「国内已正式发布的金融大模型超过42个」) |
| 五大场景与投研助手 | 5.4.2 五大典型应用场景 | text/25-ch05-04-5-4.txt:74(搜「投研助手」) |
| 五个场景各自在干什么 | 5.4.2 | text/25-ch05-04-5-4.txt:77(搜「最有可能首先得到广泛应用的场景」) · text/25-ch05-04-5-4.txt:98(搜「传统的风控方法已难以应对」) · text/25-ch05-04-5-4.txt:128(搜「初步核定、定损、赔付」) · text/25-ch05-04-5-4.txt:161(搜「精准获客及个性化营销服务能力」) · text/25-ch05-04-5-4.txt:191(搜「服务的温度远低于人工客服」) |
| 浦发的审计知识库 | 5.4.2 | text/25-ch05-04-5-4.txt:92(搜「审计知识库」) |
| 度小满风控与众安理赔 | 5.4.2 | text/25-ch05-04-5-4.txt:119(搜「轩辕风控大模型」) · text/25-ch05-04-5-4.txt:146(搜「众安科技」) |
| 工商银行的客服重 构 | 5.4.2 | text/25-ch05-04-5-4.txt:194(搜「工商银行」) |
| 高管态度调查 | 5.4.3 大模型重塑后的金融业 | text/25-ch05-04-5-4.txt:211(搜「超过90%的受访者」) |
| 政务大模型数量与提供商 | 5.5.1 政务大模型产业图谱 | text/26-ch05-05-5-5.txt:36(搜「国内已发布至少12个政务大模型」) |
| 三句口号 | 5.5 政务大模型 | text/26-ch05-05-5-5.txt:25(搜「一网统管」) |
| 三句口号各自对应哪类事 | 5.5.2 智能政务服务新范式 | text/26-ch05-05-5-5.txt:77(搜「指挥中心的指标模板较为固定」) · text/26-ch05-05-5-5.txt:107(搜「找不到服务入口」) · text/26-ch05-05-5-5.txt:134(搜「公文的写作、审核、处置主要依赖人工」) |
| 城市治理与 CityGPT | 5.5.2 智能政务服务新范式 | text/26-ch05-05-5-5.txt:92(搜「CityGPT」) |
| 12345 热线的两个百分比 | 5.5.2 | text/26-ch05-05-5-5.txt:110(搜「12345政务服务便民热线」) |
| 华为盘古政务的公文速度 | 5.5.2 | text/26-ch05-05-5-5.txt:143(搜「盘古政务大模型」) |
| 政务市场预测与落地难处 | 5.5.3 政务大模型发展趋势 | text/26-ch05-05-5-5.txt:163(搜「6612.78亿元」) · text/26-ch05-05-5-5.txt:184(搜「政务服务场景复杂多样」) |
| 工业智能四阶段 | 5.6.1 从工业小知识到工业大知识 | text/27-ch05-06-5-6.txt:16(搜「萌芽期」) |
| 四个阶段各自卡在哪 | 5.6.1 | text/27-ch05-06-5-6.txt:30(搜「生产环节的数据难以被有效采集」) · text/27-ch05-06-5-6.txt:33(搜「感知期」) · text/27-ch05-06-5-6.txt:36(搜「感知增强期」) · text/27-ch05-06-5-6.txt:39(搜「认知提升期」) |
| 工业最难落地的三条原因 | 5.6 工业大模型 | text/27-ch05-06-5-6.txt:16(搜「烟囱式数据」) |
| 中外制造业 AI 普及率 | 5.6.1 | text/27-ch05-06-5-6.txt:42(搜「中国制造企业的AI应用普及率则为11%」) |
| 工业大模型数量与吉利案例 | 5.6.2 工业大模型产业图谱 | text/27-ch05-06-5-6.txt:59(搜「国内正式发布的工业大模型超过21个」) · text/27-ch05-06-5-6.txt:62(搜「吉利—百度·文心汽车行业大模型」) |
| 三波次市场红利 | 5.6.3 市场红利的三波次释放 | text/27-ch05-06-5-6.txt:82(搜「三波次」) · text/27-ch05-06-5-6.txt:97(搜「第一波次市场红利」) |
| 工业案例里 75% 是语言大模型 | 5.6.3 | text/27-ch05-06-5-6.txt:100(搜「75%的应用为语言大模型」) |
| 大模型 + CAD/CAE/EDA | 5.6.3 | text/27-ch05-06-5-6.txt:109(搜「大模型+CAD」) · text/27-ch05-06-5-6.txt:115(搜「Cadence」) |
| 大小模型长期共存 | 5.6.4 | text/27-ch05-06-5-6.txt:165(搜「工业大模型和小模型预计将长期共存」) |
| 工业数据量的门槛 | 5.6.4 | text/27-ch05-06-5-6.txt:171(搜「10万级别的图片数据」) |