跳到主要内容

展望 — 图像进文档、能改的谈资对象与两条家训

这一章讲三件事: 图像和视频怎么被塞进「续写一份文档」这个框架; 对话式界面真正缺的那块拼图为什么是「能被反复修改的同一个对象」; 以及变聪明、变便宜的曲线各由什么驱动、天花板在哪。 原书最短的一章,却收着全书的两条家训。

1. 这一章讲什么

前三章把当下的工程学讲完了;终章抬头看路1。 作者的语气延续对数史观的开场白:人类花了几千年才琢磨出文字, 又几百年造出蒸汽机,几十年攒出电脑和手机,然后没过几年, 深度学习(让机器从大量例子里自己学出本事的那套技术)就登场了——变化只会越来越快(他还顺便致敬了预言家 Kurzweil)2

主走查是一幅画:让 AI 画一个「独眼的海盗」, 画出来了,眼睛有了,腿没有;你指着说补上,它就原地改这一处。 这个小小的往返里藏着本章全部三个话题的影子: 图进得了文档——所谓多模态(图文一起喂进同一份文档)、改动落在同一个对象上(状态化界面)、 以及那句压轴的家训——你怎么跟一个不知道自己画了什么的家伙合作。

2. 顶层全景

多模态 界面 智能
───────── ────── ──────
图→向量拼进序列 → 有状态的谈资对象 基准饱和(一半真聪明
同一套流水线 (Artifacts) + 一半被背题)
训练料也翻倍 ↓ 蒸馏/量化降价
差三步才算到位 ↓
但永远不是 psychic(心灵感应)

图说:三条趋势线最终汇到同一家训——共情这只「大智若愚的机械朋友」
怎么想;它的一切行为仍然是模仿训练文本的续写。

3. 核心原理

3.1 多模态:图像也是「一段文字」

问题很简单:续写引擎只吃 token,一张图片怎么办? 书给的答案(作者注明 OpenAI 未公开细节,大概率沿用了学术界的方案)是一条拼装流水线3:

图片 → 卷积网络抽出图像特征 → 每个特征变成一个向量
→ 向量带上位置信息(图里的相对关系不丢)
→ 和文本 token 的向量拼接成一整条序列
→ Transformer 拿它当一篇普通文档继续处理

图说:关键一步是「同维度」——图像特征被转成和文字标记一样的向量规格,
对内部结构而言,一张图就是文档开头多出的几个「词」。(流程示意按书中
所述方法复述;卷积网络是擅长从图像局部抓特征的那类网络。)

视频更简单粗暴:抽帧当多张图喂进去即可(OpenAI cookbook 演示过)3

作者给出两个「为什么重要」。其一,不可用文本捕捉的场景终于有解: 帮视障者读路牌、找建筑、认陌生环境4。 其二更根本:训练料荒。模型越大越能学会世界的细枝末节, 喂太少就会把字面背下来而不是理解世界。担忧到什么量级? 作者的原话尺度是——整整一个公开互联网的文本,可能都不够下一代的量级; 而图像视频带来的是另一量级的语料,还附带空间推理、社交线索、物理常识这类 纯文本给不了的养料5

对提示工程的启示只有三条,而且全是旧原则的新皮肤: 只放相关的图(否则分心);用文字交代这张图在对话里扮演的角色; 别发明新图式——训练集里已有的常见图表格式优先6。到哪都是小红帽。

3.2 界面:对话缺的是一个「改得动的对象」

这条观察从一句对比开始:人互相说话已经二十万年, 对着屏幕点按钮才四十年——界面往对话靠拢没错7。 但日常协作里我们聊的是「一个东西」,边聊边改、还能聊它怎么变的; 结对编程里那个文件就是谈话对象本身8

今天的聊天应用恰恰在这里瘸腿:让 ChatGPT 写个函数,之后每要一处小改, 它不能回去更新原函数,只能从头再写一遍——不是「一个演进中的对象」, 而是「对话流里的 N 个副本」;而且物件一多,「你说的是哪一个?哪个版本?」都说不清9

成书收尾之际,Anthropic 推出了 Artifacts:左侧是完整对话记录, 右侧钉着一个原地更新的工件:SVG 图、HTML、mermaid 图或代码皆可, 要求修改时对象就地变化,而不是又一轮复读10。 书里的演示正是主走查那幅画:独眼海盗画好了,用户讨论「腿和眼睛好像没了」, artifact 在右侧原位更新10

但作者当场点了三点不足11:

  1. 改动多半只发生在 UI 层:底下的提示词工程还是把整个 artifact 从头重写, 文档一长就撑不住;
  2. 一次只能谈一个,多个工件之间既难切换也难指名道姓——缺一套速记名;
  3. 用户不能直接上手改:看见个小毛病,唯一办法是叫助手整份重打; 应该让用户的改动回灌进下一次 prompt,让模型知道文件变了。

最后一条提醒接回第 11 章:模型放着不管会跑偏, 而贴身的对话交互正是让用户留在回路里纠偏的手段12

3.3 智能:一半真聪明,一半背题

坏消息先来。各家榜单上的基准测试(benchmark: 一组带标准答案的考题,用来横向比较模型)正在饱和——排名最前的模型普遍接近满分, 失去了区分度。原因有两个,一个好的一个坏的:13

  1. 模型真的更聪明了;
  2. 被污染了:题目原文(或它的复述)流传几年后散布在整个互联网, 无意中被卷进了训练集——这不是作弊动机,是效果意义上的作弊14

社区的应对双管齐下:滚动升级题库(如 Open LLM Leaderboard 2); 换用背不掉的题——ARC-AGI 这类图形模式智力测验,由程序批量生成、 取自一个大到背不完的题库,随时能出新的15

好消息有两拨。一拨来自第 04 章:RLHF 越训越好, 模型越来越会把自己的思维链摆给你看,回应自然更有用16。 另一拨省钱:大模型吃不完自己的容量,于是可以让小模型拜师—— 这个做法叫知识蒸馏(knowledge distillation):老师不再让学生逐字猜下一个词, 而是把自己对下个词的完整概率分布(那一整张倾向清单)直接教给它; 学生学得更准更快,代价只是比老师略笨一点点, 换来的是显著更便宜、更跑得动17

架构侧还有量化(quantization):参数从 32 位浮点近似成 8 位, 体积大跌、成本随之跳水、速度相应上涨18

于是作者敢做这样的预测:今天太贵的明天会更便宜,今天装不下的明天会装得下, 今天不够聪明的明天会更聪明。但话锋立刻折回来,这一章最重要的一句话是:

它们永远不会通灵(psychic)。提示词里没有的信息,模型手里也没有。 要么你放进提示词,要么给它工具让它自己去查19

4. 作者的判断与证据:两条家训收束全书

结论一章干净利落地交出了全书总纲,就是两句话20:

  1. LLM 只是模仿训练文本的续写引擎;
  2. 要共情这台机器,理解它是怎么「想」的

第一句的实际操作是原书第 4 章的小红帽原则照抄一遍: 让提示词踩训练数据的熟路,输出就可预期——比如排版交给 markdown, 有标准格式的数据就别自创格式21。 第二句被具体化为一只「大智若愚的机械朋友」(big dumb mechanical friend)的五副面孔22:

面孔相伴的守则
容易分心别拿「万一有用」的东西塞满提示词(呼应契诃夫之枪)
提示词它也得读得懂你自己读不明白的渲染结果,它一样懵
需要人引路给明确的指令,该带例子就带例子
不是神仙信息要么入 prompt,要么给它工具去取
没有内心独白让它把思考出声(思维链),答案质量立刻不一样

作者的收尾判断相当大胆:软件会因此变得易造,一次性应用(disposable apps) 和高个性定制的时代要来,应用的体验也会沾染模型的本性——不确定、开放、弹性23。 结句借了 Terry Pratchett《The Fifth Elephant》(1999):世界正在流沙上踢踏, 奖杯属于跳得最好的那位舞者24

判断(我们的,不是书里的): 终章最能检验这本书成色的,是「never be psychic」 这半句——两年回头看,推理类模型确实让部分「信息不在 prompt 里」的问题 变成了「推理可以补」的问题,边界朝外挪了一格; 但挪动的方式仍是作者教的工具箱(先想清楚、给它检索),而非推翻。 这本书的可引用寿命也因此主要押在机制层,而不是任何一款产品名词上。 如果错,会错在: 若后续架构允许模型在不写入文档的情况下保持内部状态 并跨好多步持续思考,「提示词是唯一输入」的前提将松动,本书的定律需要重新表述。

5. 边界与局限

  • 三张快照的保质期不一:蒸馏/量化部分老化最快——书里举例 32 位到 8 位, 今天的压缩技术与 MoE(混合专家:多个小网络分工协作的架构)已远超当时的新颖度(补充(不在书里,来自通用知识):此为趋势注脚,非精确对照);
  • 「OpenAI 大概率沿用学术界方法」是作者的谨慎推测,官方细节至今未完整披露3;
  • 数据荒论断是行业担忧的转述(increasing concern),不是测算, 视频与人工合成出来的料等新料源的规模未纳入5;
  • Artifacts 三点批评基于该功能发布初期形态;此后同类「有状态工作对象」面板 在主流对话产品中陆续出现(ChatGPT Canvas 等——补充(不在书里,来自通用知识),未逐一核验);
  • 全章无数字论证,是展望而非实验章,引用时适合当立场而非当证据。

6. 可带走的

主走查一行回顾:独眼海盗图 → 缺腿被指出 → 右侧面板原地补腿—— 图进了文档,改动落在一个对象上,而合作方式仍是那条老规矩:把要求说明白。

  1. 多模态不神秘:图像特征(轮廓、纹理这类局部信息)转成与文本同一规格的向量,拼接后共用同一台 Transformer3;
  2. 图文混排三条守规:相关图才放、用文字交代角色、别发明新图式6;
  3. 留意训练料荒:连整个公开互联网都可能不够,图文语料是新矿5;
  4. 对话 UI 的靶心是有状态的谈资对象:评判任何新界面,就看它能不能原地演化同一个东西910;
  5. benchmark 分数要看新鲜度:饱和 = 真聪明 + 背题两者掺半14;
  6. 降本两条腿:蒸馏教概率分布,量化压位数——今天的奢侈是明天的标配1718;
  7. 永不通灵:prompt 里没有的信息它就没有,这是全书的铁底19;
  8. 两只手都记住:它只是模仿者(所以踩熟路),又是伙伴(所以要共情)20

7. 原文地图

主题原书章原文位置
对数史观与加速Chapter 11text/14-ch11-chapter-11-looking-ahead.txt:3(搜「logarithmic scale」) · :15(搜「Kurzweil」)
多模态流水线Chapter 11text/14-ch11-chapter-11-looking-ahead.txt:24(搜「convolutional network」) · :26(搜「positional information」) · :30(搜「sample images from the video」)
视障辅助与数据荒Chapter 11text/14-ch11-chapter-11-looking-ahead.txt:34(搜「vision impairment」) · :39(搜「run out of training data」) · :44(搜「entire public internet」)
图文提示三守则Chapter 11text/14-ch11-chapter-11-looking-ahead.txt:54(搜「relevant to the conversation」) · :55(搜「properly introduces their role」)
对话界面对比Chapter 11text/14-ch11-chapter-11-looking-ahead.txt:64(搜「clicking buttons」) · :66(搜「stateful objects of discourse」)
N 个副本之弊Chapter 11text/14-ch11-chapter-11-looking-ahead.txt:75(搜「over and over again, from scratch」) · :79(搜「Which version?」)
Artifacts 登场Chapter 11text/14-ch11-chapter-11-looking-ahead.txt:82(搜「wrapping up this book」) · :88(搜「right side of the screen」) · :94(搜「peg-legged pirate」)
三点批评Chapter 11text/14-ch11-chapter-11-looking-ahead.txt:97(搜「paradigm is very close」) · :101(搜「longer documents」) · :106(搜「shorthand names」) · :110(搜「whole file」)
留在回路Chapter 11text/14-ch11-chapter-11-looking-ahead.txt:125(搜「stray off course」)
benchmark 饱和与污染Chapter 11text/14-ch11-chapter-11-looking-ahead.txt:134(搜「have saturated」) · :137(搜「cheating by training」) · :140(搜「accidentally pulled」)
ARC-AGIChapter 11text/14-ch11-chapter-11-looking-ahead.txt:142(搜「ARC-AGI」) · :144(搜「large space of possible tests」)
蒸馏与量化Chapter 11text/14-ch11-chapter-11-looking-ahead.txt:157(搜「A training approach known as」) · :160(搜「full set of probabilities」) · :170(搜「8-bit parameters」)
趋势与 never psychicChapter 11text/14-ch11-chapter-11-looking-ahead.txt:172(搜「cheaper tomorrow」) · :176(搜「never be psychic」)
两条家训Chapter 11text/14-ch11-chapter-11-looking-ahead.txt:182(搜「nothing more than text completion」) · :185(搜「empathize with the LLM」)
机械朋友五面孔Chapter 11text/14-ch11-chapter-11-looking-ahead.txt:201(搜「mechanical friend」) · :205(搜「piece of information matters」) · :208(搜「fully rendered prompt」) · :216(搜「internal monologues」)
尾声引用Chapter 11text/14-ch11-chapter-11-looking-ahead.txt:222(搜「disposable apps」) · :230(搜「quicksand」) · :233(搜「The Fifth Elephant」)

Footnotes

  1. 出处:「Chapter 11. Looking Ahead」第 14-17 段(text/14-ch11-chapter-11-looking-ahead.txt:14,搜「pace of change is fast now」)。

  2. 出处:「Chapter 11. Looking Ahead」第 3-15 段(text/14-ch11-chapter-11-looking-ahead.txt:3,搜「logarithmic scale」);Kurzweil 致敬(:15,搜「Kurzweil」)。

  3. 出处:「Chapter 11. Looking Ahead」第 20-31 段(text/14-ch11-chapter-11-looking-ahead.txt:24,搜「convolutional network」);「OpenAI has not disclosed details about how exactly the model works」(:22);位置信息(:25-27,搜「positional information」);视频抽帧(:29-31)。 2 3 4

  4. 出处:「Chapter 11. Looking Ahead」第 32-36 段(text/14-ch11-chapter-11-looking-ahead.txt:34,搜「vision impairment」)。

  5. 出处:「Chapter 11. Looking Ahead」第 37-49 段(text/14-ch11-chapter-11-looking-ahead.txt:39,搜「run out of training data」);「literally the text of the entire public internet may not be enough」(:43-44);空间推理/社交线索/物理常识(:48-49)。 2 3

  6. 出处:「Chapter 11. Looking Ahead」第 50-58 段(text/14-ch11-chapter-11-looking-ahead.txt:53,搜「only images that are」);交代角色(:55,搜「properly introduces their role」);勿造新图式(:56-58,搜「common format that is」)。 2

  7. 出处:「Chapter 11. Looking Ahead」第 62-64 段(text/14-ch11-chapter-11-looking-ahead.txt:64,搜「200,000 years」)。

  8. 出处:「Chapter 11. Looking Ahead」第 67-72 段(text/14-ch11-chapter-11-looking-ahead.txt:70,搜「Pair programming is a great example」)。

  9. 出处:「Chapter 11. Looking Ahead」第 72-81 段(text/14-ch11-chapter-11-looking-ahead.txt:75,搜「over and over again, from scratch」;「N objects into the conversation」在 :76);指代困难与 Which version?(:77-79)。 2

  10. 出处:「Chapter 11. Looking Ahead」第 82-91 段(text/14-ch11-chapter-11-looking-ahead.txt:82,搜「introduced Artifacts」);类型清单(SVG/HTML/mermaid/code)(:84-85);左 transcript 右 artifact、原地更新(:87-90)。 2 3

  11. 出处:「Chapter 11. Looking Ahead」第 75 段(text/14-ch11-chapter-11-looking-ahead.txt:75,搜「from scratch」所在批评段);更长文档撑不住(:101);多个 artifacts 难互动难指名(:102-106);用户不能直接编辑(:107-112)。

  12. 出处:「Chapter 11. Looking Ahead」第 124-127 段(text/14-ch11-chapter-11-looking-ahead.txt:125,搜「stray off course」)。

  13. 出处:「Chapter 11. Looking Ahead」第 132-135 段(text/14-ch11-chapter-11-looking-ahead.txt:133,搜「sets with known answers」)。

  14. 出处:「Chapter 11. Looking Ahead」第 136-140 段(text/14-ch11-chapter-11-looking-ahead.txt:137,搜「cheating by training」);非故意的互联网扩散(:138-139)。 2

  15. 出处:「Chapter 11. Looking Ahead」第 141-145 段(text/14-ch11-chapter-11-looking-ahead.txt:142,搜「nonmemorizable benchmarks such as ARC-AGI」);算法生成的大题库(:144-145)。

  16. 出处:「Chapter 11. Looking Ahead」第 151-153 段(text/14-ch11-chapter-11-looking-ahead.txt:151,搜「better RLHF training」);越来越会摆思维链(:152)。

  17. 出处:「Chapter 11. Looking Ahead」第 154-164 段(text/14-ch11-chapter-11-looking-ahead.txt:158,搜「teacher」);完整概率分布的教学(:159-160);「slight decrease in accuracy」(:162)与显著更便宜快速(:163-164)。 2

  18. 出处:「Chapter 11. Looking Ahead」第 167-171 段(text/14-ch11-chapter-11-looking-ahead.txt:169,搜「32-bit floating point numbers」)。 2

  19. 出处:「Chapter 11. Looking Ahead」第 172-177 段(text/14-ch11-chapter-11-looking-ahead.txt:172,搜「cheaper tomorrow」);「they will never be psychic」(:176,搜「psychic」首现于本段)。 2

  20. 出处:「Chapter 11. Looking Ahead」第 180-184 段(text/14-ch11-chapter-11-looking-ahead.txt:182,搜「nothing more than text completion engines」);empathize(:184-185)。 2

  21. 出处:「Chapter 11. Looking Ahead」第 193-199 段(text/14-ch11-chapter-11-looking-ahead.txt:193,搜「well-trodden course」行内;或直接搜「well-trodden course」);markdown 与标准格式建议(:195-198)。

  22. 出处:「Chapter 11. Looking Ahead」第 200-218 段(text/14-ch11-chapter-11-looking-ahead.txt:200,搜「big, dumb」);五条小标题(easily distracted / decipher / led / not psychic / internal monologues)(:203-217)。

  23. 出处:「Chapter 11. Looking Ahead」第 219-225 段(text/14-ch11-chapter-11-looking-ahead.txt:222,搜「individualized apps or even disposable apps」);不确定性体验(:223)。

  24. 出处:「Chapter 11. Looking Ahead」第 226-233 段(text/14-ch11-chapter-11-looking-ahead.txt:230,搜「tap-dancing on quicksand」);出处脚注 Terry Pratchett, The Fifth Elephant (1999)(:233)。