展望 — 图像进文档、能改的谈资对象与两条家训
这一章讲三件事: 图像和视频怎么被塞进「续写一份文档」这个框架; 对话式界面真正缺的那块拼图为什么是「能被反复修改的同一个对象」; 以及变聪明、变便宜的曲线各由什么驱动、天花板在哪。 原书最短的一章,却收着全书的两条家训。
1. 这一章讲什么
前三章把当下的工程学讲完了;终章抬头看路1。 作者的语气延续对数史观的开场白:人类花了几千年才琢磨出文 字, 又几百年造出蒸汽机,几十年攒出电脑和手机,然后没过几年, 深度学习(让机器从大量例子里自己学出本事的那套技术)就登场了——变化只会越来越快(他还顺便致敬了预言家 Kurzweil)2。
主走查是一幅画:让 AI 画一个「独眼的海盗」, 画出来了,眼睛有了,腿没有;你指着说补上,它就原地改这一处。 这个小小的往返里藏着本章全部三个话题的影子: 图进得了文档——所谓多模态(图文一起喂进同一份文档)、改动落在同一个对象上(状态化界面)、 以及那句压轴的家训——你怎么跟一个不知道自己画了什么的家伙合作。
2. 顶层全景
多模态 界面 智能
───────── ────── ──────
图→向量拼进序列 → 有状态的谈资对象 基准饱和(一半真聪明
同一套流水线 (Artifacts) + 一半被背题)
训练料也翻倍 ↓ 蒸馏/量化降价
差三步才算到位 ↓
但永远不是 psychic(心灵感应)
图说:三条趋势线最终汇到同一家训——共情这只「大智若愚的机械朋友」
怎么想;它的一切行为仍然是模仿训练文本的续写。
3. 核心原理
3.1 多模态:图像也是「一段文字」
问题很简单:续写引擎只吃 token,一张图片怎么办? 书给的答案(作者注明 OpenAI 未公开细节,大概率沿用了学术界的方案)是一条拼装流水线3:
图片 → 卷积网络抽出图像特征 → 每个特征变成一个向量
→ 向量带上位置信息(图里的相对关系不丢)
→ 和文本 token 的向量拼接成一整条序列
→ Transformer 拿它当一篇普通文档继续处理
图说:关键一步是「同维度」——图像特征被转成和文字标记一样的向量规格,
对内部结构而言,一张图就是文档开头多出的几个「词」。(流程示意按书中
所述方法复述;卷积网络是擅长从图像局部抓特征的那类网络。)
视频更简单粗暴:抽帧当多张图喂进去即可(OpenAI cookbook 演示过)3。
作者给出两个「为什么重要」。其一,不可用文本捕捉的场景终于有解: 帮视障者读路牌、找建筑、认陌生环境4。 其二更根本:训练料荒。模型越大越能学会世界的细枝末节, 喂太少就会把字面背下来而不是理解世界。担忧到什么量级? 作者的原话尺度是——整整一个公开互联网的文本,可能都不够下一代的量级; 而图像视频带来的是另一量级的语料,还附带空间推理、社交线索、物理常识这类 纯文本给不了的养料5。
对提示工程的启示只有三条,而且全是旧原则的新皮肤: 只放相关的图(否则分心);用文字交代这张图在对话里扮演的角色; 别发明新图式——训练集里已有的常见图表格式优先6。到哪都是小红帽。
3.2 界面:对话缺的是一个「改得动的对象」
这条观察从一句对比开始:人互相说话已经二十万年, 对着屏幕点按钮才四十年——界面往对话靠拢没错7。 但日常协作里我们聊的是「一个东西」,边聊边改、还能聊它怎么变的; 结对编程里那个文件就是谈话对象本身8。
今天的聊天应用恰恰在这里瘸腿:让 ChatGPT 写个函数,之后每要一处小改, 它不能回去更新原函数,只能从头再写一遍——不是「一个演进中的对象」, 而是「对话流里的 N 个副本」;而且物件一多,「你说的是哪一个?哪个版本?」都说不清9。
成书收尾之际,Anthropic 推出了 Artifacts:左侧是完整对话记录, 右侧钉着一个原地更新的工件:SVG 图、HTML、mermaid 图或代码皆可, 要求修改时对象就地变化,而不是又一轮复读10。 书里的演示正是主走查那幅画:独眼海盗画好了,用户讨论「腿和眼睛好像没了」, artifact 在右侧原位更新10。
但作者当场点了三点不足11:
- 改动多半只发生在 UI 层:底下的提示词工程还是把整个 artifact 从头重写, 文档一长就撑不住;
- 一次只能谈一个,多个工件之间既难切换也难指名道姓——缺一套速记名;
- 用户不能直接上手改:看见个小毛病,唯一办法是叫助手整份重打; 应该让用户的改动回灌进下一次 prompt,让模型知道文件变了。
最后一条提醒接回第 11 章:模型放着不管会跑偏, 而贴身的对话交互正是让用户留在回路里纠偏的手段12。
3.3 智能:一半真聪明,一半背题
坏消息先来。各家榜单上的基准测试(benchmark: 一组带标准答案的考题,用来横向比较模型)正在饱和——排名最前的模型普遍接近满分, 失去了区分度。原因有两个,一个好的一个坏的:13
- 模型真的更聪明了;
- 被污染了:题目原文(或它的复述)流传几年后散布在整个互联网, 无意中被卷进了训练集——这不是作弊动机,是效果意义上的作弊14。
社区的应对双管齐下:滚动升级题库(如 Open LLM Leaderboard 2); 换用背不掉的题——ARC-AGI 这类图形模式智力测验,由程序批量生成、 取自一个大到背不完的题库,随时能出新的15。
好消息有两拨。一拨来自第 04 章:RLHF 越训越好, 模型越来越会把自己的思维链摆给你看,回应自然更有用16。 另一拨省钱:大模型吃不完自己的容量,于是可以让小模型拜师—— 这个做法叫知识蒸馏(knowledge distillation):老师不再让学生逐字猜下一个词, 而是把自己对下个词的完整概率分布(那一整张倾向清单)直接教给它; 学生学得更准更快,代价只是比老师略笨一点点, 换来的是显著更便宜、更跑得动17。
架构侧还有量化(quantization):参数从 32 位浮点近似成 8 位, 体积大跌、成本随之跳水、速度相应上涨18。
于是作者敢做这样的预测:今天太贵的明天会更便宜,今天装不下的明天会装得下, 今天不够聪明的明天会更聪明。但话锋立刻折回来,这一章最重要的一句话是:
它们永远不会通灵(psychic)。提示词里没有的信息,模型手里也没有。 要么你放进提示词,要么给它工具让它自己去查19。