跳到主要内容

AI 遇上科学 — 加速发现的新引擎

这一章讲三件事: 为什么「从数据里找规律」在 2020 年代突然从统计工具升级成了科学引擎—— 蛋白质折叠这个困了生物学五十年的问题是怎么被撬开的; 同一套「大海捞针」的逻辑怎么在药物、材料、气象、数学、天文、核聚变各领域反复奏效; 以及 AI 在科学里的边界——关联不是因果、预测不是理解、双重用途的风险。

它在全书链条里的位置:具身智能让 AI 走进三维的物理世界,科学智能让 AI 走进抽象的知识世界—— 两者共享同一条主线:让 AI 从被动的语言生成器,变成主动参与世界运转的智能体。 第 03 章的注意力和第 08 章的扩散模型,在这里都变成了科研仪器。

顶层全景:一台插在关键工位上的涡轮增压器

数据(序列/图像/曲线/模拟) ──► AI 扫描巨大可能空间 ──► 候选答案

人类:该不该做、意味着什么 ◄──────────────────────────┤
实验:最终判决(硬证据) ──► 结果回流改进下一代模型 ◄────┘

图说: 全章十几个案例共用这一张图。AI 的工作是「找候选」, 人的工作是「挑苗子、给方向、担责任」,实验的工作是「给硬证据」—— 三个角色少一个,科学发现就不成立。

1. 科学研究的第四范式

2024 年 10 月 9 日,诺贝尔化学奖颁给了 David Baker(计算蛋白质设计)和 Demis Hassabis、 John Jumper(AlphaFold);前一天,物理学奖刚颁给 Hopfield 和 Hinton(神经网络奠基人)。 连续两天,两个基础科学奖项都把 AI 相关工作放到了聚光灯下——这不意味着 AI 已经替科学家 戴上白大褂走进实验室,它只是第一次如此醒目地进入科学最高奖项的叙事中心1

背景是科学研究方法论的第四次大迁移2:

范式核心做法代表
一:经验观察自然积累知识伽利略的摆、开普勒的行星、门捷列夫周期表
二:理论数学模型解释规律牛顿力学、麦克斯韦方程、相对论
三:计算数值求解理论模型气象模拟、分子动力学、宇宙演化模拟
四:数据驱动从海量数据中自动发现规律2007 年 Jim Gray 提出;天文、基因、对撞机数据人力已无法处理

Gray 提出第四范式时深度学习还没起飞,那时主要靠统计方法;过去十年深度学习让第四范式 突然有了真正的工具——AI 能从数据里学出复杂的非线性规律。结果是一批标志性成果: AlphaFold 把蛋白质结构预测变成可大规模调用的计算能力,GraphCast 和盘古气象给天气预报 多出一条机器学习路线,AlphaGeometry 在奥赛几何题上接近顶尖人类,GNoME 把材料候选空间筛了一遍又一遍3。 书里给这一章下的定义句:AI 最擅长的,是在巨大可能空间里帮人类更快地找到值得验证的候选答案, 再交给科学家去判断哪些是真理4

2. 蛋白质折叠:五十年的圣杯

生命的许多基本过程——消化、免疫、神经信号、复制 DNA——都由蛋白质完成, 而蛋白质的功能由它的 3D 结构决定:钥匙形的插锁孔、通道形的运分子、剪刀形的切蛋白5。 结构由什么决定?由氨基酸序列——一条 20 种字母组成的字符串。

难点在 Levinthal 悖论:同一个序列理论上能折叠成天文数字般多的形状, 按随机试错要「折到宇宙下班都还没结束」,可现实中蛋白质几秒钟就折好了—— 像一团乱线突然自己打成漂亮的中国结。「序列如何决定结构」这个问题困扰了生物学整整五十年6。 过去测定一个结构要几个月到几年(X 射线晶体学、核磁共振、冷冻电镜), 实验结构数据库和自然界巨大的蛋白质总量相比,像图书馆里只编好了一小部分索引7

3. AlphaFold 怎么做的

1994 年设立的 CASP 竞赛两年一届,让参赛者预测刚测出但未公开的结构。从 1994 到 2018, 最好成绩(GDT 分数,90 分算「实验级准确」)从 20 多分挤牙膏般爬到 40–50 分; 2018 年 AlphaFold 1 首次亮相把最困难目标推到约 60 分;2020 年 AlphaFold 2 在许多目标上 接近实验精度——CASP 组织者由此认为:蛋白质折叠的核心结构预测问题,在很大范围内已经被计算方法突破了8

它的技术核心是四件事的组合,单独看都不新,组合起来加上大规模训练就产生了质变9:

设计做什么为什么有效
多序列比对(MSA)把这个蛋白在多个物种里的「亲戚」序列一起看演化保留了结构重要的位置,这些信号神经网络可以用
成对距离预测预测任意两个氨基酸的距离分布,而不是直接回归 3D 坐标一个更容易学的问题
端到端训练从序列直接到 3D 结构抛开传统的「能量最小化」
注意力机制每个位置都能看到全蛋白捕捉长程空间依赖

赢下 CASP 之后,DeepMind 公开了代码和模型,与欧洲生物信息学研究所共建数据库, 免费公开了超过 2 亿个蛋白质的预测结构。书里给这个礼物的定性很准:预测结构不是实验结构, 它像一张高质量地图——能指路,却不能替代实地勘探10。 2024 年两位发明者获诺贝尔化学奖,生物学家感慨结构预测这件苦活 「终于有了一台不会抱怨的超级打工机」11

AlphaFold 3(2024 年 5 月)再往前一步:不只预测单个蛋白,还预测蛋白质与小分子药物、DNA、RNA、 离子的复合结构——药物怎么结合靶点、酶怎么催化、抗体怎么识别病毒,都是复合结构问题。 它底层用到了扩散模型(第 08 章那套「从噪声还原」):同一种思想,既可以画猫, 也可以帮科学家观察分子如何拥抱、推开或缠在一起12。开放生态也在追赶:MIT 等团队的 Boltz-1 主打完全开源,Boltz-2 又把「结构长什么样」推进到「结合得有多强」—— 生命科学 AI 正在从单一明星系统走向可复现、可比较、可改造的工具链13

4. 从蛋白质往下再走两层:基因、细胞与大脑

AlphaFold 解决的是蛋白质问题,生命科学的每个层级都有 AI 在改变现状14

基因层:AlphaMissense(2023)给人类基因组约 7100 万种可能的错义突变打分——哪些可能致病、 哪些可能良性,相当于给遗传病诊断多了一本详细得多的参考手册(手册不是判决书,临床判断仍要结合 家族史和医生经验)15。DNA 基础模型(在海量数据上先训好、再适配各任务的模型)是更激进的方向:用海量基因组序列学「DNA 语言」, Arc Institute 的 Evo 及 2025 年的 Evo 2 训练规模已达万亿级核苷酸,尝试学习调控片段和基因的关系。 书里的口径收得很紧:DNA 不是英语作文,改一个字母可能没事,也可能把整段生物程序改坏; 这些模型是「从进化遗留序列里学统计规律的候选生成器」,不是读懂生命的万能编辑器16

细胞层:单细胞测序能同时测几百万个细胞的基因表达,传统统计力不从心; AI(变分自编码器、图模型、对比学习)把高维表达谱聚成有意义的细胞类型、发现稀有亚群、 追踪细胞状态演化。书里的比方漂亮:单细胞数据像挤满人的体育场,每个人在同时小声说话, AI 的任务是从嗡嗡声里听出谁是免疫细胞、谁是神经细胞、谁是没人注意到的新角色17

大脑层:一立方毫米皮层就有约 10 万个神经元、上亿条突触连接。2024 年 FlyWire 联盟公布了 成年果蝇全脑连接组——约 14 万个神经元、5000 多万条突触连接,背后的分割、识别、重建高度依赖深度学习。 脑机接口(Neuralink、Synchron、BrainGate)用机器学习把瘫痪病人的意图转成文字和光标, 有真实人体试验进展,但离日常医疗还很远——科学进展很了不起,但还没有魔法18

5. 药物发现与蛋白质设计

一款新药从候选分子到上市常常要十年左右,大量时间和钱花在筛选上—— 书里的比方极其传神:药物研发像在一座巨型停车场里找一辆没挂牌的车,AI 不保证你一定找到, 但能先帮你把最不可能的几百万辆排除掉19

三类典型用法20:分子属性预测(图神经网络——擅长处理「分子这种由原子连成的图」的网络——给几百万候选分子打分:溶解度、毒性、结合强度); 药物-靶点相互作用预测(AlphaFold 3 的主场);生成式分子设计(直接生成自然界未必存在的新分子—— 但要过可合成性、稳定性、毒性检验,不能因为模型画得漂亮就直接进药柜)。 AI 驱动的药企(Recursion、Insilico、Isomorphic Labs 等)已经在压缩前期筛选, 第一批 AI 辅助设计的候选药进了临床试验——临床试验是终极考场,AI 能提高命中率, 却不能替药物通过安全性和有效性考试21

更激进的是从头设计蛋白质:David Baker 团队的 RFDiffusion 让研究者指定目标 (「设计一个能结合 A 蛋白的新蛋白」),AI 生成候选序列,再用 AlphaFold 验证结构—— 一些设计出的新抗体、新酶、新生物传感器已被合成出来并真的工作22。 书里还讲了一个温暖的预告片故事:2008 年上线的 Foldit 把蛋白质折叠做成游戏, 2011 年玩家们帮着解析了困扰研究者多年的病毒蛋白酶结构,论文把玩家列为共同作者—— 复杂科学问题不一定只能由少数专家闭门解决23

6. 材料与化学:超级筛沙机

2023 年 DeepMind 的 GNoME 用图神经网络从已有材料数据库出发,生成并筛选了约 220 万种候选晶体结构, 其中约 38 万种被认为稳定性较高——一下把候选清单扩大了近一个数量级, 部分候选已被自动化实验平台合成出来24。 书里的定性:AI 在这里更像一台超级筛沙机,它能把金粒子可能出现的地方筛出来, 却不能保证每一粒闪光的东西都是黄金——从候选结构到可规模化生产的材料, 中间还有合成难度、成本、稳定性、环境影响一长串关卡25

化学侧还有三条线:催化剂设计(Open Catalyst Project 开放数千万条模拟数据训练吸附能预测, 服务绿色催化制氢);AI 势函数(DeepMD、NequIP、MACE 等用神经网络学原子间相互作用, 以接近量子化学的精度把原本只能观察几皮秒的微观过程拉长到接近真实实验的尺度); 反应预测与逆合成分析(IBM RXN 等,像「实验室里多了一位虚拟同事」)26。 书里给这些工具的共同脾气下了判语:它们给的是建议,不是判决——没有哪一个会替你拍板说「就合成这个」, 最后那一步仍然要有人把分子做出来、放进反应釜、看它到底成不成27

7. 气象与气候:改写的是经济学,不是大气的底线

传统数值天气预报(NWP)准确但昂贵:每次预报要算几小时、动用上千核超算。 2022 年底到 2023 年,GraphCast(DeepMind)、Pangu-Weather(华为)等大型气象模型几乎同时出现, 用过去 40 年的历史天气数据训练——在多项基准上达到或超过传统 NWP 的准确度,推断却快得多28。 这改变了气象预报的经济学:原本只有少数大国气象局承担得起的全球预报, 中小国家和学术团体也有机会参与了;后续的 Aurora 等地球系统基础模型又把天气、污染、海浪、气旋 往统一框架里装29

两条冷静的边界值得原文级记住。其一,气候建模和极端天气预测里 AI 有两类用途 (便宜替代模型、物理加 ML 混合模型),但越是极端事件越要警惕外推失败—— 模型没见过的灾难,不会因为我们很想预测它,就乖乖出现在训练集里30。 其二,也是这一节最值得带走的:这些模型刷新的是预报的速度和成本,而不是大气本身的可预报上限—— 洛伦兹半个世纪前就说过蝴蝶效应;再快的 AI 也改不了这条混沌的物理底线, 它顶多让我们更便宜、更频繁地重算那张随时会失效的预报图31

8. 在噪声里捞信号

天文和粒子物理的共同形状:数据多到人看不完,得先筛出那几个值得回头细看的瞬间32。 书里给的五个案例,各有各的洪流33:

场景数据洪流AI 干什么
引力波检测信号极弱、埋在 LIGO 的噪声海洋里卷积网络扫海量数据,初筛候选事件——像夜班保安,但重大发现仍要严格统计检验
系外行星恒星光变曲线里藏着微弱遮挡2017 年神经网络找到 Kepler-90i,使其恒星成为首个已知有 8 颗行星的系外系统;人类提想法,AI 把曲线翻到手抽筋也不抱怨
星系分类各天文台图像数以百万计Galaxy Zoo 曾靠众包,CNN(擅长看图的卷积网络)接手自动分类,人只看真正有趣的异常
粒子物理LHC 每秒产生的碰撞数据多到当场倒掉绝大部分AI 辅助触发决策——不是「一眼认出希格斯」,而是在极短时间内做大量概率判断,别让珍贵事件进数据垃圾桶
核聚变控制等离子体连一毫秒的犹豫都不允许DeepMind 2022 年用强化学习控制托卡马克等离子体形态——AI 远没解决核聚变,只是在一个关键子问题上递了把好扳手

9. 数学与形式化证明

数学是看起来离 AI 最远的学科——最纯粹的推理活动。但它恰恰最适合同一套分工: 神经网络提候选,符号系统严验证34

AlphaGeometry(2024 年 1 月):在国际数学奥林匹克几何题上解出 30 题中的 25 题,接近金牌水平。 书里对几何题的洞察很妙:答案往往不长,难的是那条辅助线从哪冒出来—— AlphaGeometry 像一个从不喊「我想不出来了」的队友,专门负责疯狂试辅助线; 神经网络凭直觉提辅助线,符号引擎严格验证这些线是否通向证明35。 2024 年 7 月,AlphaProof 加 AlphaGeometry 2 解出当年 IMO 4 道题,达银牌水平—— 首次在真实 IMO 题目上拿到奖牌级表现;但边界也在:这类系统依赖形式化环境和搜索, 不等于 AI 已能像顶尖数学家那样自由提出研究计划36

AlphaTensor(2022):把矩阵乘法算法的寻找建模成游戏,像 AlphaZero 下棋一样搜索—— 重新发现了大量已知最优算法,并在一些情形(如 4×5 乘 5×5)找到了超越人类已知最优的新算法 (1969 年 Strassen 的 7 次乘法对比朴素的 8 次,是这条历史的起点)37。 书里的谨慎:发现一个更快的矩阵乘法算法,和证明一个深刻新定理还不是同一件事, 但它说明 AI 可以参与数学创造的某些环节38。 更长期的方向是形式化数学:Lean 这类证明助手语言让计算机可验证地重写数学 (Terence Tao 等人在用),AI 帮助从自然语言证明生成 Lean 代码—— 候选构造可以由搜索提出,但要落到符号推理或形式化证明上,才能从灵感变成可靠结论39

10. 从 AI 工具到 AI 研究助理

过去科研软件是工具箱(统计的管统计、仿真的管仿真);现在的变化是 AI 把工具串起来, 变成更像「研究助理」的系统:能读文献、列假设、写代码、跑实验、整理结果、失败后修改计划—— 它还不是独立科学家,但已经不只是一个按钮40。书里列了几条具体路线:

  • 多智能体科研原型:Google 的 AI Co-Scientist 把生物医学假设生成做成多智能体系统 (有想点子的、有批评的、有排序的),2026 年 5 月与 ERA(用大模型加树搜索生成专家级实验软件) 同日发表两篇 Nature 论文——AI 正从「帮你补一段脚本」进入「替你探索一片算法空间」的阶段41;
  • 科研驾驶舱:统一环境里提目标,系统自动分解任务、调模型、记数据、追失败—— 驾驶舱比喻的要点是:AI 越强,越需要清楚的目标、权限、日志、版本管理和复现机制42;
  • 机器人实验室:最硬核的一条——利物浦大学的 mobile robot chemist 在实验室里移动、操作仪器、 连续做实验,AI 提出下一组条件、机器人执行、结果回流。没有实验闭环,再漂亮的假设也只是猜测43

日常研究者的版本也已经在发生:文献地图、图表理解(像速度惊人的实习生——翻得快总结得快, 但偶尔会把坐标轴看反,重要结论必须回原图)、假设生成、新颖性初筛 (小心把「没人写过这句话」误判成「没人做过这件事」)、实验规划(主动学习挑最有信息量的下一组实验)、 代码与写作——过去被琐事挤占的时间,正在被腾出来做更有创造性的事44

11. 从假设驱动到数据驱动

更深层的变化在科学方法本身。传统科学是假设驱动的:先有假设、再设计实验验证—— 它适合「已知世界」,我们有理论当出发点。但数据爆炸时代,许多前沿问题变量太多、相互作用太复杂, 人类经验给不出方向——数据驱动的方法补上了一条新路:让 AI 从海量数据中发现模式,再提假设供人验证45

现代科研越来越多地采用 「AI 发现 + 人类解释 + 实验验证」 的循环: AI 扫描庞大可能空间找候选,人类选出值得研究的,实验给出最终判决。 分工一句话:人类负责判断该不该做、做出来意味着什么;AI 负责探索能不能做、怎么做出来46

12. 挑战:六道关卡加一个哲学问题

书里列的挑战,每一道都值得单独立牌47:

  • 关联 vs 因果:AI 擅长找关联,科学最关心因果。经典例子:夏天一到冰淇淋销量和溺水事故一起涨 ——冰淇淋会把人推下水吗?当然不是,共同原因是高温和暑假。科学要问的不是「谁和谁一起变」, 而是「如果我们干预其中一个,另一个会不会改变」;AI 从医学数据里找到的许多「关联」, 大部分经不起严格的因果分析48;
  • 可解释性:AI 能预测蛋白质结构,却解释不了「为什么这样折叠」的物理机制。 应用上够准就行,基础研究里是大问题——科学研究追求的是理解,而不止于预测49;
  • 数据质量与外推:AI 会忠实学习实验噪声和测量偏差,结论可能是偏差的放大而非真实规律; 模型在熟悉地盘表现好,不代表新条件下可靠——要问的不是「平均准确率高不高」, 而是「离开熟悉地盘之后会不会胡说八道」50;
  • 物理约束与守恒律:能量、质量、电荷守恒、对称性是自然界的硬规则,由不得模型当作文题自由发挥—— 好的科学模型不只要「看起来像」,还要「不能违反基本规律」,否则就是「会背物理公式的骗子, 讲得头头是道,最后连账都算不平」51;
  • 复现、出处与责任:模型版本、提示词、随机种子、清洗脚本、AI 改过哪些文字,都会影响结果; 未来的科研 AI 要像严肃实验室一样管理自己——像一个唠叨但可靠的实验记录员52;
  • 双重用途(dual use):设计蛋白质能做药,也可能被滥用于有害分子;优化反应能提效,也可能助 synthesis 危险品。 科学的加速器如果没有刹车,速度越快,越需要知道自己正开向哪里53

最后是那个哲学问题:一门越来越依赖「预测而非证明」的学科,还算不算科学? 四百年来近代科学的正统是「从数据中提炼可被人脑理解的数学规律」; AI 带来的新范式常常提供能预测但不能解释的模型——AlphaFold 知道结构却说不出理由。 这个问题没有现成答案,但它本身正是 AI 时代最深刻的一个科学哲学之问54。 下一章,视线从「AI 能做什么」转向「AI 不该做什么」——能力越强,需要被约束的地方越多。

主走查:一条 200 个氨基酸的序列,从字符串到实验室

这条走查贯穿本章。 输入:一条新测序的、200 个氨基酸的蛋白质序列,功能未知。 凡书里给出的机制注明;演示数当场标明。

① 先找「亲戚」。(§3 MSA) 把序列放进数据库搜索,找出它在其他物种里的演化亲戚——比如 37 条相似序列 (条数为演示设定)。演化的逻辑:结构上重要的位置,亿万年间被保留了下来; 亲戚们在这些位置上的保守与变异,就是折叠方式的线索。

② 预测成对距离,而不是直接猜坐标。(§3) 对 200×200 = 40000 对氨基酸组合(组合数为演示计算),模型各自输出一个距离分布—— 「这两位大概率隔 8 埃,但也可能 15 埃」。先学分布再定坐标, 比一步回归三维坐标是个容易得多的中间问题。

③ 端到端折成三维坐标。(§3) 注意力让每个位置看到全局,网络直接输出 200 个氨基酸的三维坐标—— 从字符串到立体结构一次完成,不走「能量最小化」的老路。

④ 看置信度,决定信多少。(§3) 输出附带逐位置的置信度标注:第 1–150 位 pLDDT 高(高置信),最后 50 位一片低置信(分段为演示设定)。 低置信区可能是无序柔性区,也可能就是预测失败——地图能指路,不能替代实地勘探: 这一段的结构结论,只能当假设。

⑤ 接上小分子,看怎么结合。(§3) 用 AlphaFold 3 的复合结构预测:把候选药物分子和蛋白一起喂进去, 扩散模型采样「分子怎么拥抱蛋白的结合口袋」——结合姿态有了,但这只是计算假设。

⑥ 交回实验室,闭环闭合。(§5 §11) 湿实验室合成表达这个蛋白,做结合实验验证姿态与亲和力;实验结果回流,成为下一代模型的训练数据。 AI 负责「能不能做、怎么做出来」,人类负责「该不该做、意味着什么」,实验负责最终判决—— 走完这一圈,「序列决定结构」的五十圣杯,才真正变成一件日常工具。

作者的判断与证据

书里给出可核事实或文献来源的地方:

  • 2024 年两天两个诺奖的获奖人与时间;CASP 从 20 多分到 60 分(AlphaFold 1)再到接近 90 分(AlphaFold 2)的曲线; AlphaFold 数据库超 2 亿结构;AlphaMissense 覆盖约 7100 万种变异;FlyWire 果蝇连接组 14 万神经元、 5000 多万突触;GNoME 的 220 万候选、38 万高稳定;AlphaGeometry 30 题解 25、AlphaTensor 的 4×5×5 新算法、 Strassen 7 次乘法;GraphCast/Pangu 用 ERA5 四十年数据;Kepler-90i 的 2017 年发现;DeepMind 2022 年 TCV 等离子体控制——这些数字书里都给了明确出处或论文编号181015182435372833;
  • Evo 2 的万亿级核苷酸训练量、Co-Scientist/ERA 两篇 2026 Nature 论文,书里如实标注了口径与限制1641

书里标成判断或立场的地方:

  • 「AI 最擅长在巨大可能空间里找值得验证的候选答案」——全章的定性判断4;
  • 「刷新的是预报速度和成本,不是可预报上限」——作者对气象 AI 的边界判断31;
  • 「预测而非证明的学科还算不算科学」——作者明确写成开放的科学哲学之问54;
  • 「AGI 在科学中的角色:一种观点说大幅自动化科研,一种观点说创造性仍高度依赖人——我们不知道谁对」——书里照实承认不确定53

判断(我们的,不是书里的): 本章所有成功案例共享一个前置条件,值得单独拎出来—— 它们都站在「验证便宜或至少可自动化」的领域里:蛋白质结构有 X 射线和冷冻电镜可对答案, 材料有自动化实验平台可合成,数学有符号引擎可验证,几何有证明可检查。 而「验证贵」的领域(临床医学、社会科学、长期生态学)里,AI 的进展明显慢一拍—— 不是预测难,是判卷难。据此推论:AI for Science 的下一个突破点,会出现在把验证成本 打下来一两个数量级的地方(自动化实验室、形式化验证、大规模模拟器),而不是预测模型本身。 如果错,会错在: 若生成式模型的候选质量高到「命中率」不再重要(比如十中九), 筛选与验证的瓶颈论就失效;书里 15.9 的 ERA 一节(替你探索算法空间)已经在这个方向上探了一步。

边界与局限

  • 对应关系: 本章对应原书第 15 章全文;原书习题里「第五范式」——即相对正文四范式而言的说法——没有正文支持,本组拆解不引申。
  • 没展开的: AlphaFold 2 的网络结构细节(Evoformer 等模块名)书里本就只给了四条思想,我们保持同层; 天文各案例的技术细节、脑机接口的算法、机器人实验室的硬件配置,各留一段; AlphaEvolve 与 BASF 供应链案例属于「决策支持」而非科学发现,书里自己也这么提醒,我们只留名字。
  • 一处口径声明: 15.9 节的 Co-Scientist/ERA/Gemini for Science 是 2026 年 5 月的事件,距成书极近, 书里明确说 Literature Insights「还没有 Nature 论文背书」——本组拆解继承这一区分。
  • 时效性: Boltz-2、Evo 2、Aurora 均为 2025 年前后的工作;这个领域季度级更新,数字请查当时文献。

可带走的

  1. 第四范式的判词:AI 最擅长在巨大可能空间里找到值得验证的候选答案,再交给科学家判断真理。
  2. Levinthal 悖论一句话:随机试遍所有形状要折到宇宙下班,现实里蛋白质几秒折好;AlphaFold 四件套(多序列比对/成对距离/端到端/注意力)撬开了这个五十年的圣杯——但预测结构是地图,不是实地勘探
  3. 药物研发是停车场找没挂牌的车,GNoME 是筛沙机——AI 能排除最不可能的几百万辆、筛出金子可能在的地方,但不能保证闪光的就是黄金。
  4. 气象 AI 刷新的是速度和成本,不是大气的可预报上限;天文粒子物理的共同形状是数据多到看不完,先筛出值得回头细看的瞬间。
  5. 数学的分工:神经网络疯狂试辅助线,符号引擎严格验证——候选可以来自搜索,结论必须落到形式化。
  6. AI 发现 + 人类解释 + 实验验证:人类判断该不该做,AI 探索能不能做,实验给最终判决。
  7. 相关不等于因果:科学要问「干预其中一个,另一个会不会变」,不是「谁和谁一起变」。
  8. 科学模型不许违反守恒律:否则就是会背公式的骗子,讲得头头是道,最后账都算不平。
  9. 双重用途:加速器没有刹车,速度越快越需要知道开向哪里。
  10. 最深的追问:一门越来越依赖「预测而非证明」的学科,还算不算科学——AI 时代最深刻的科学哲学之问。

原文地图

主题原书节原文位置
两天两个诺奖15.1text/16-ch15-15-ai.txt:8(搜“诺贝尔化学奖颁给了”) · text/15-ch14.txt 不适用 · text/16-ch15-15-ai.txt:12(搜“叙事中心”)
四范式15.1text/16-ch15-15-ai.txt:16(搜“第一范式:经验”) · text/16-ch15-15-ai.txt:23(搜“Jim Gray”)
候选答案判词15.1text/16-ch15-15-ai.txt:40(搜“巨大可能空间里帮人类更快”) · text/16-ch15-15-ai.txt:45(搜“方向盘还在科学家手里”)
蛋白质与结构15.2.1text/16-ch15-15-ai.txt:54(搜“3D 结构决定”) · text/16-ch15-15-ai.txt:57(搜“20 种氨基酸组成的字符串”)
Levinthal 悖论15.2.1text/16-ch15-15-ai.txt:60(搜“Levinthal”) · text/16-ch15-15-ai.txt:62(搜“中国结”)
结构测定之贵15.2.1text/16-ch15-15-ai.txt:64(搜“几个月到几年”) · text/16-ch15-15-ai.txt:66(搜“很小一部分索引”)
CASP 数字15.2.2text/16-ch15-15-ai.txt:74(搜“50 分,90 分才算”) · text/16-ch15-15-ai.txt:77(搜“约 60 分”) · text/16-ch15-15-ai.txt:83(搜“被计算方法突破了”)
AlphaFold 四设计15.2.3text/16-ch15-15-ai.txt:104(搜“多序列比对(MSA)”) · text/16-ch15-15-ai.txt:111(搜“成对距离预测”) · text/16-ch15-15-ai.txt:113(搜“端到端训练”) · text/16-ch15-15-ai.txt:115(搜“长程空间依赖”) · text/16-ch15-15-ai.txt:116(搜“产生了质变”)
两亿与地图15.2.4text/16-ch15-15-ai.txt:126(搜“超过 2 亿个蛋白质”) · text/16-ch15-15-ai.txt:128(搜“替代实地勘探”)
超级打工机15.2.4text/16-ch15-15-ai.txt:135(搜“超级打工机”)
AlphaFold 3 与扩散15.2.5text/16-ch15-15-ai.txt:139(搜“复合结构及相互作用”) · text/16-ch15-15-ai.txt:148(搜“观察分子如何拥抱”)
开源追赶15.2.5text/16-ch15-15-ai.txt:158(搜“工具链”) · text/16-ch15-15-ai.txt:158(搜“结合亲和力、细胞环境”)
停车场比方15.3.1text/16-ch15-15-ai.txt:167(搜“没挂牌的车”)
三类用法15.3.1text/16-ch15-15-ai.txt:172(搜“分子属性预测”) · text/16-ch15-15-ai.txt:178(搜“不能因为模型画得漂亮”)
临床终极考场15.3.1text/16-ch15-15-ai.txt:184(搜“安全性和有效性考试”)
RFDiffusion 与 Foldit15.3.2text/16-ch15-15-ai.txt:190(搜“RFDiffusion”) · text/16-ch15-15-ai.txt:200(搜“共同作者”)
AlphaMissense15.4.1text/16-ch15-15-ai.txt:220(搜“AlphaMissense”) · text/16-ch15-15-ai.txt:223(搜“不是判决书;真正的临床判断”)
Evo 与 DNA 口径15.4.1text/16-ch15-15-ai.txt:227(搜“改坏”) · text/16-ch15-15-ai.txt:233(搜“候选生成器”)
单细胞体育场15.4.2text/16-ch15-15-ai.txt:243(搜“挤满人的体育场”)
连接组与脑机15.4.3text/16-ch15-15-ai.txt:255(搜“5000 多万条突触连接”) · text/15-ch14.txt 不适用 · text/16-ch15-15-ai.txt:264(搜“但还没有”)
GNoME15.5.1text/16-ch15-15-ai.txt:275(搜“220 万种候选晶体结构”) · text/16-ch15-15-ai.txt:283(搜“都是黄金”)
催化与势函数15.5.2text/16-ch15-15-ai.txt:292(搜“Open Catalyst Project”) · text/16-ch15-15-ai.txt:302(搜“真实实验的尺度”)
建议不是判决15.5.3text/16-ch15-15-ai.txt:309(搜“虚拟同事”) · text/16-ch15-15-ai.txt:313(搜“放进反应釜”)
气象新路线15.6.1text/16-ch15-15-ai.txt:323(搜“GraphCast”) · text/16-ch15-15-ai.txt:328(搜“推断速度快很多”) · text/16-ch15-15-ai.txt:329(搜“经济学”)
极端天气与上限15.6.2text/16-ch15-15-ai.txt:348(搜“乖乖出现在训练集里”) · text/16-ch15-15-ai.txt:350(搜“混沌的物理底线”)
引力波与行星15.8.1text/16-ch15-15-ai.txt:415(搜“夜班保安”) · text/16-ch15-15-ai.txt:419(搜“Kepler-90i”) · text/16-ch15-15-ai.txt:422(搜“手抽筋也不抱怨”)
分类与触发15.8.2text/16-ch15-15-ai.txt:443(搜“数据垃圾桶”) · text/16-ch15-15-ai.txt:443(搜“概率判断”)
聚变15.8.3text/15-ch14.txt 不适用 · text/16-ch15-15-ai.txt:453(搜“关键子问题上”) · text/16-ch15-15-ai.txt:457(搜“更好用的扳手”)
AlphaGeometry15.7.1text/16-ch15-15-ai.txt:360(搜“30 题中”) · text/16-ch15-15-ai.txt:366(搜“疯狂试辅助线”) · text/16-ch15-15-ai.txt:369(搜“严格验证这些辅助线”)
AlphaProof 边界15.7.1text/16-ch15-15-ai.txt:374(搜“银牌水平”) · text/16-ch15-15-ai.txt:376(搜“自由提出研究计划”)
AlphaTensor15.7.2text/16-ch15-15-ai.txt:382(搜“7 次标量乘法”) · text/16-ch15-15-ai.txt:388(搜“更少乘法次数”) · text/16-ch15-15-ai.txt:391(搜“某些环节”)
Lean15.7.3text/16-ch15-15-ai.txt:393(搜“Lean”) · text/16-ch15-15-ai.txt:402(搜“从灵感变成可靠结论”)
研究助理15.9.1text/16-ch15-15-ai.txt:499(搜“不只是一个按钮”)
Co-Scientist 与 ERA15.9.1text/16-ch15-15-ai.txt:507(搜“ERA”) · text/16-ch15-15-ai.txt:520(搜“探索一片算法空间”)
驾驶舱15.9.1text/16-ch15-15-ai.txt:533(搜“坐在了驾驶位上”) · text/16-ch15-15-ai.txt:534(搜“版本管理和复现机制”)
机器人实验室15.9.1text/16-ch15-15-ai.txt:537(搜“mobile robot chemist”) · text/16-ch15-15-ai.txt:538(搜“再漂亮的假设也只是猜”)
实习生比方15.9.3text/16-ch15-15-ai.txt:581(搜“速度惊人的实习生”) · text/16-ch15-15-ai.txt:591(搜““没人做过这件事””)
数据驱动分工15.9.2text/16-ch15-15-ai.txt:567(搜“AI 发现 + 人类解释 + 实验验证”) · text/16-ch15-15-ai.txt:570(搜“怎么做出来”)
因果15.10text/16-ch15-15-ai.txt:640(搜“如果我们干预其中一个”) · text/16-ch15-15-ai.txt:638(搜“高温和暑假”)
可解释15.10text/16-ch15-15-ai.txt:659(搜“而不止于预测”)
外推15.10text/16-ch15-15-ai.txt:668(搜“离开熟悉地盘之后会不会胡”)
守恒律15.10text/16-ch15-15-ai.txt:673(搜“作文题自由发挥”) · text/16-ch15-15-ai.txt:677(搜“连账都算不平”)
复现与记录员15.10text/16-ch15-15-ai.txt:686(搜“唠叨但可靠的实验记录员”)
双重用途15.10text/16-ch15-15-ai.txt:693(搜“双重用途(dual use)”) · text/16-ch15-15-ai.txt:694(搜“越需要知道自己正开”)
认识论追问15.10.1text/16-ch15-15-ai.txt:716(搜“预测而非证明”) · text/16-ch15-15-ai.txt:717(搜“科学哲学命题”)

Footnotes

  1. 出处:「15.1」第 8 段(text/16-ch15-15-ai.txt:8,搜“诺贝尔化学奖颁给了”)与第 12 段(text/16-ch15-15-ai.txt:12,搜“叙事中心”)。 2

  2. 出处:第 16 段(text/16-ch15-15-ai.txt:16,搜“第一范式:经验”)与第 23 段(text/16-ch15-15-ai.txt:23,搜“Jim Gray”)。

  3. 出处:第 36 段(text/16-ch15-15-ai.txt:36,搜“工具箱”)。

  4. 出处:第 40 段(text/16-ch15-15-ai.txt:40,搜“巨大可能空间里帮人类更快”)。 2

  5. 出处:「15.2.1」第 54 段(text/16-ch15-15-ai.txt:54,搜“3D 结构决定”)。

  6. 出处:第 60 段(text/16-ch15-15-ai.txt:60,搜“Levinthal”)、第 62 段(text/16-ch15-15-ai.txt:62,搜“中国结”)、第 63 段(搜“整整 50 年”)。

  7. 出处:第 64 段(text/16-ch15-15-ai.txt:64,搜“几个月到几年”)、第 66 段(text/16-ch15-15-ai.txt:66,搜“很小一部分索引”)。

  8. 出处:「15.2.2」第 74 段(text/16-ch15-15-ai.txt:74,搜“50 分,90 分才算”)、第 77 段(text/16-ch15-15-ai.txt:77,搜“约 60 分”)、第 83 段(text/16-ch15-15-ai.txt:83,搜“被计算方法突破了”)。 2

  9. 出处:「15.2.3」第 104 段(text/16-ch15-15-ai.txt:104,搜“多序列比对(MSA)”)、第 111 段(text/16-ch15-15-ai.txt:111,搜“成对距离预测”)、第 116 段(text/16-ch15-15-ai.txt:116,搜“产生了质变”)。

  10. 出处:「15.2.4」第 126 段(text/16-ch15-15-ai.txt:126,搜“超过 2 亿个蛋白质”)、第 128 段(text/16-ch15-15-ai.txt:128,搜“替代实地勘探”)。 2

  11. 出处:第 135 段(text/16-ch15-15-ai.txt:135,搜“超级打工机”)。

  12. 出处:「15.2.5」第 139 段(text/16-ch15-15-ai.txt:139,搜“复合结构及相互作用”)、第 148 段(text/16-ch15-15-ai.txt:148,搜“观察分子如何拥抱”)。

  13. 出处:第 158 段(text/16-ch15-15-ai.txt:158,搜“结合亲和力、细胞环境”)、第 158 段(text/16-ch15-15-ai.txt:158,搜“工具链”)。

  14. 出处:「15.4」引言第 211 段(text/16-ch15-15-ai.txt:211,搜“远不止于此”)。

  15. 出处:「15.4.1」第 220 段(text/16-ch15-15-ai.txt:220,搜“AlphaMissense”)、第 222 段(text/16-ch15-15-ai.txt:222,搜“参考手册”)。 2

  16. 出处:第 227 段(text/16-ch15-15-ai.txt:227,搜“改坏”)、第 233 段(text/16-ch15-15-ai.txt:233,搜“候选生成器”)。 2

  17. 出处:「15.4.2」第 243 段(text/16-ch15-15-ai.txt:243,搜“挤满人的体育场”)。

  18. 出处:「15.4.3」第 255 段(text/16-ch15-15-ai.txt:255,搜“5000 多万条突触连接”)、第 264 段(text/16-ch15-15-ai.txt:264,搜“但还没有”)。 2

  19. 出处:「15.3.1」第 167 段(text/16-ch15-15-ai.txt:167,搜“没挂牌的车”)。

  20. 出处:第 172 段(text/16-ch15-15-ai.txt:172,搜“分子属性预测”)、第 178 段(text/16-ch15-15-ai.txt:178,搜“不能因为模型画得漂亮”)。

  21. 出处:第 184 段(text/16-ch15-15-ai.txt:184,搜“安全性和有效性考试”)。

  22. 出处:「15.3.2」第 190 段(text/16-ch15-15-ai.txt:190,搜“RFDiffusion”)、第 195 段(text/16-ch15-15-ai.txt:195,搜“被合成出来并工作”)。

  23. 出处:第 199 段(text/16-ch15-15-ai.txt:199,搜“Foldit”)、第 200 段(text/16-ch15-15-ai.txt:200,搜“共同作者”)。

  24. 出处:「15.5.1」第 275 段(text/16-ch15-15-ai.txt:275,搜“220 万种候选晶体结构”)、第 278 段(text/16-ch15-15-ai.txt:278,搜“一个数量级”)。 2

  25. 出处:第 281 段(text/16-ch15-15-ai.txt:281,搜“超级筛”)、第 283 段(text/16-ch15-15-ai.txt:283,搜“都是黄金”)。

  26. 出处:「15.5.2」第 292 段(text/16-ch15-15-ai.txt:292,搜“Open Catalyst Project”)、第 302 段(text/16-ch15-15-ai.txt:302,搜“真实实验的尺度”)、「15.5.3」第 309 段(text/16-ch15-15-ai.txt:309,搜“虚拟同事”)。

  27. 出处:第 311 段(text/16-ch15-15-ai.txt:311,搜“建议,不是判决”)、第 313 段(text/16-ch15-15-ai.txt:313,搜“放进反应釜”)。

  28. 出处:「15.6.1」第 323 段(text/16-ch15-15-ai.txt:323,搜“GraphCast”)、第 328 段(text/16-ch15-15-ai.txt:328,搜“推断速度快很多”)。 2

  29. 出处:第 329 段(text/16-ch15-15-ai.txt:329,搜“经济学”)、第 334 段(text/16-ch15-15-ai.txt:334,搜“Aurora”)。

  30. 出处:「15.6.2」第 348 段(text/16-ch15-15-ai.txt:348,搜“乖乖出现在训练集里”)。

  31. 出处:第 350 段(text/16-ch15-15-ai.txt:350,搜“混沌的物理底线”)。 2

  32. 出处:「15.8.3」末段第 461 段(text/16-ch15-15-ai.txt:461,搜“回头细看的瞬间”)。

  33. 出处:「15.8.1」第 415 段(text/16-ch15-15-ai.txt:415,搜“夜班保安”)、第 419 段(text/16-ch15-15-ai.txt:419,搜“Kepler-90i”)、第 422 段(text/16-ch15-15-ai.txt:422,搜“手抽筋也不抱怨”);「15.8.2」第 443 段(text/16-ch15-15-ai.txt:443,搜“数据垃圾桶”);「15.8.3」第 453 段(text/16-ch15-15-ai.txt:453,搜“关键子问题上”)。 2

  34. 出处:「15.7」引言第 354 段(text/16-ch15-15-ai.txt:354,搜“最纯粹的推理活动”)。

  35. 出处:「15.7.1」第 360 段(text/16-ch15-15-ai.txt:360,搜“30 题中”)、第 366 段(text/16-ch15-15-ai.txt:366,搜“疯狂试辅助线”)、第 369 段(text/16-ch15-15-ai.txt:369,搜“严格验证这些辅助线”)。 2

  36. 出处:第 374 段(text/16-ch15-15-ai.txt:374,搜“银牌水平”)、第 376 段(text/16-ch15-15-ai.txt:376,搜“自由提出研究计划”)。

  37. 出处:「15.7.2」第 382 段(text/16-ch15-15-ai.txt:382,搜“7 次标量乘法”)、第 388 段(text/16-ch15-15-ai.txt:388,搜“更少乘法次数”)。 2

  38. 出处:第 391 段(text/16-ch15-15-ai.txt:391,搜“某些环节”)。

  39. 出处:「15.7.3」第 393 段(text/16-ch15-15-ai.txt:393,搜“Lean”)、第 402 段(text/16-ch15-15-ai.txt:402,搜“从灵感变成可靠结论”)。

  40. 出处:「15.9.1」第 499 段(text/16-ch15-15-ai.txt:499,搜“不只是一个按钮”)。

  41. 出处:第 507 段(text/16-ch15-15-ai.txt:507,搜“ERA”)、第 520 段(text/16-ch15-15-ai.txt:520,搜“探索一片算法空间”)。 2

  42. 出处:第 533 段(text/16-ch15-15-ai.txt:533,搜“驾驶位上”)、第 534 段(text/16-ch15-15-ai.txt:534,搜“版本管理和复现机制”)。

  43. 出处:第 537 段(text/16-ch15-15-ai.txt:537,搜“mobile robot chemist”)、第 538 段(text/16-ch15-15-ai.txt:538,搜“假设也只是猜”)。

  44. 出处:「15.9.3」第 581 段(text/16-ch15-15-ai.txt:581,搜“速度惊人的实习生”)、第 591 段(text/16-ch15-15-ai.txt:591,搜““没人做过这件事””)、第 614 段(text/16-ch15-15-ai.txt:614,搜“更有创造性的事”)。

  45. 出处:「15.9.2」第 565 段(text/16-ch15-15-ai.txt:565,搜“数据驱动的方法更有效”)。

  46. 出处:第 567 段(text/16-ch15-15-ai.txt:567,搜“AI 发现 + 人类解释 + 实验验证”)、第 570 段(text/16-ch15-15-ai.txt:570,搜“怎么做出来”)。

  47. 出处:「15.10」引言第 628 段(text/16-ch15-15-ai.txt:628,搜“严肃挑战”)。

  48. 出处:第 640 段(text/16-ch15-15-ai.txt:640,搜“如果我们干预其中一个”)、第 634 段(text/16-ch15-15-ai.txt:634,搜“保持怀疑”)。

  49. 出处:第 659 段(text/16-ch15-15-ai.txt:659,搜“而不止于预测”)。

  50. 出处:第 661 段(text/16-ch15-15-ai.txt:661,搜“忠实学习这些偏差”)、第 668 段(text/16-ch15-15-ai.txt:668,搜“离开熟悉地盘之后会不会胡”)。

  51. 出处:第 673 段(text/16-ch15-15-ai.txt:673,搜“作文题自由发挥”)、第 677 段(text/16-ch15-15-ai.txt:677,搜“连账都算不平”)。

  52. 出处:第 684 段(text/16-ch15-15-ai.txt:684,搜“像严肃实验室一样管理自己”)、第 686 段(text/16-ch15-15-ai.txt:686,搜“唠叨但可靠的实验记录员”)。

  53. 出处:第 693 段(text/16-ch15-15-ai.txt:693,搜“双重用途(dual use)”)、第 694 段(text/16-ch15-15-ai.txt:694,搜“越需要知道自己正开”)、第 703 段(text/16-ch15-15-ai.txt:703,搜“我们不知道谁对”)。 2

  54. 出处:「15.10.1」第 716 段(text/16-ch15-15-ai.txt:716,搜“预测而非证明”)、第 717 段(text/16-ch15-15-ai.txt:717,搜“科学哲学命题”)。 2