跳到主要内容

走进物理世界 — 具身智能(给 AI 一个身体)与机器人

这一章讲三件事: 为什么有一派研究者坚持认为智能需要身体——物理常识不是读出来的,是摔出来的; 机器人范式怎么从「感知-规划-控制」三支柱的经典管道,走到把看、说、做装进同一个模型的 VLA; 以及当动作开始改变物理世界之后,世界模型、仿真、触觉和安全各自要补上什么。

它在全书链条里的位置:前面十四章的智能体都活在数字世界,失败顶多是文本层面的; 这一章把同一套设计原则(记忆、规划、反馈、可逆动作、人在环)带进一个不再宽容失败的世界。 第 01 章说「给它一个身体时会反复回来」,第 08 章留了半页机器人与音画的重叠——都在这里收口。

顶层全景:从三支柱到一具身体

经典时代(1960s–2010s) 学习时代(2020– )
感知 → 规划 → 控制 三支柱 VLA:看+说 → 同一个模型 → 动作
结构化环境里非常好用 世界知识(借自大模型) + 操作技能(自采演示)
开放环境规则写不完 ↓
│ 动作的三种表示:词元化 / 分块 / 扩散·流匹配
│ ↓
└────────► 世界模型:Dreamer 脑内演习 · 视频生成 · JEPA 预测意义

硬件与迁移:仿真器(摔一万次只费电) → 域随机化 → 真机少量微调 → 触觉补皮肤

落点:工厂试点先行,家庭是最后一个战场;安全/可靠性/成本/数据四道硬约束

图说: 全章的叙事是一条范式接力——三支柱把结构化世界做完了,学习方法接手开放世界, VLA 把大模型的常识借给身体,世界模型把试错搬进脑内,最后一切要过物理世界这道不宽容的考官。

1. 从数字到物理

前面大部分章节的 AI 主要生活在数字世界:看图、读文、写代码、生视频, 但这些都发生在屏幕、机房主机和实验数据里——它没有手、没有身体、不知道「重」是什么感觉、「冷」是什么感觉1

至少有一派研究者认为,智能不能只在数字世界里打转:我们的大脑是几十亿年在物理世界生存演化的结果, 人类婴儿到两岁前通过观察和操作学到的物理常识——「杯子倒过来水会洒」「硬物落地会弹」「热的东西会烫手」—— 至今没有被 AI 完整掌握。具身智能(Embodied Intelligence)说的就是这件事: 要让 AI 获得更扎实的物理常识,它很可能需要身体,或者至少需要与物理世界足够真实的互动—— 在真实环境里感知、学习、行动,而不是关在笔记本电脑里空转2

这几年具身智能明显升温:特斯拉 Optimus、Figure 02、宇树 G1、Apptronik Apollo、电动 Atlas 集中进入公众视野。 书里的态度值得借用:既要看见进展,也要保留怀疑——机器人不是 ChatGPT 装上轮子, 物理世界会用摩擦、重力、碰撞和长尾意外给每个模型上课3

2. 三岁小孩会的最难

这就是著名的摩拉维克悖论(Moravec's Paradox):对计算机来说,下棋、算题、写证明这些成年人觉得 「高级」的事反而相对容易;而走路、抓杯子、收拾桌面这些三岁小孩会的事,却难得要命—— 因为后者不是靠几条规则完成的,而是几十亿年演化打磨出的感知、平衡、触觉和运动控制4。 书里把它说得很生动:机器人最难学的,往往是你每天早上半睡半醒也能完成的那套动作,而非博士论文里的东西5。 第 01 章埋的「下棋比走路难?恰恰相反」在此兑现。

3. 经典机器人的三根支柱

传统机器人学(1960 年代到 2010 年代主导)建立在三个支柱上:感知(摄像头、激光雷达、力传感器, 用几何和物理原理处理信号)、规划(搜索算法加运动学,算出每个关节每一刻的角度)、 控制(反馈控制、误差修正,经典武器是 PID 控制器)6。 这三根支柱在结构化环境(工厂流水线、仓储、手术机器人)里非常好用——物体位置和任务流程可预测; 到了非结构化环境(你家、街道、野外),环境太复杂、物体太多样、任务太开放,规则根本写不完7

历史上有两个名字值得记。一个是 SRI 六十年代的 Shakey——第一台把感知、规划、行动结合的移动机器人, 「先看清世界、再做完整计划、最后执行」的路线代表;这条路优雅,但在真实世界经常被打断: 刚规划好,门被人关了;刚伸手,杯子滑了;刚认出香蕉,猫把它叼走了8。 另一个是 Rodney Brooks 的行为式机器人学,著名论文标题就叫《大象不下棋》—— 真正的智能未必从抽象推理开始,很多时候从身体和环境的实时耦合中长出来; 会走、会躲、会保持平衡,这些「低级」能力可能正是高级智能的地基9

还有一个常被低估的难点:接触。聊天机器人说错一句话,改掉就行; 机器人手指碰到杯子的那一刻,摩擦、弹性、惯性、微小滑动全来了—— 书里的比喻是接触像一场临时谈判:手说「我要抓你」,杯子说「我可能会滑」,桌子说「别把我也掀了」10。 这就是为什么抓取、插拔、折叠、拧瓶盖看起来简单,实际很难。

4. 学习怎么改变机器人

强化学习让机器人通过试错学走路、跑步、抓取,不用手写规则,只给奖励信号。 但它有个致命问题:样本效率太低——训练一个机器人学会走路要等效于几年的真实尝试, 而真实机器人摔跤会坏,所以早期 RL 机器人主要停留在仿真里11

2020 年后的三个关键突破让机器人学习实用起来12:

  1. 仿真到现实(sim-to-real):先在仿真里用 RL 训几千年的游戏时间,再迁移到真机; 仿真中故意随机化光照、摩擦、重量,让策略对真实变化也稳(行话叫鲁棒);
  2. 大规模演示学习:人类遥控演示,AI 从中学——比纯 RL 快得多,还能学到更精细的动作;
  3. 预训练加微调:像大语言模型一样,在海量机器人数据上预训练一个「机器人大模型」,再按任务微调。

5. 视觉-语言-动作模型:世界知识与操作技能分开积累

视觉-语言-动作模型(Vision-Language-Action,VLA)是近年最受关注的新范式, 想法直白:把大语言模型(看、听说)扩展到能输出机器人动作—— 输入是摄像头图像加语言指令(「把桌上的红苹果给我」),输出是下一步动作(关节角度或末端位姿变化), 整个映射用一个神经网络学13

书里点出 VLA 最关键的洞察:让「世界知识」和「操作技能」分开积累、合起来使用14—— 世界知识(什么是苹果、什么是红色)来自互联网的海量文字图像,规模以万亿词元计; 操作技能(怎么弯手指、怎么保持平衡)来自机器人演示数据,只有几百万条轨迹,差了好几个数量级。 VLA 用「先继承后微调」的办法,让机器人不必从零学「世界是什么」,直接从大模型借来,再专心学「动作怎么做」。 书里也把话说实:VLA 还远不能处理「任何」语言任务,但用语言给机器人下任务这个接口已经被打通15

6. 动作怎么变成可学的信号

图像是像素、语言是词元,动作是什么?这个表示选择直接决定精度、速度和可学性16。四条路线17:

表示怎么做得失
动作词元化RT-1/RT-2 把每一维动作离散成 256 个格子,一步动作就是一串「词」,复用语言模型架构工程省事;精度受格子数限制,逐词预测偏慢
动作分块(把动作切成段)一次预测未来一串动作(比如 50 步),ACT 是代表减少误差累积、捕捉多步连贯(写字倒水)、降低推断频率——大模型出「计划书」,本地快速执行
扩散动作头把动作当连续分布,用扩散模型从噪声还原一串未来动作(Diffusion Policy 是奠基之作)能表达多峰分布——绕障碍左边右边都行;直接回归只能给「平均答案」,结果谁也不像
流匹配扩散的「快速亲戚」,直接学一个速度场,沿确定轨迹从噪声走到动作(π0 采用)高频连续控制的可行路线

演化主线一句话:从把动作当语言到把动作当分布、从一步一预测到一次一段、从慢精确到快流畅—— 没有统一答案,按任务选18

7. 两个代表系列:借常识的 RT,分层的 π

RT 系列(Google DeepMind)定义了范式的许多基础概念。RT-1(2022)部署 13 台机械臂、 17 个月收集约 13 万次演示、覆盖 700 多种任务,模型只有约 3500 万参数—— 按大模型尺度很小,但它证明了「Transformer 能像处理语言一样处理机器人动作」, 自然语言第一次变得像机器人接口19。RT-2(2023)是更大的突破:不从零训练,而是从已训好的 视觉-语言模型(PaLI-X 55B / PaLM-E 12B)出发再做机器人微调——它能执行「把灭绝的动物拿起来」 这种需要知识的指令(推断出恐龙玩偶是灭绝动物),演示数据里根本不用出现过「恐龙」20。 但书里也钉了风险:语言模型继承来的常识有时是纸面常识,到了真实桌面上,还得接受物理世界的考试21。 后续的 RT-X 联合 34 家机构做了 Open X-Embodiment 数据集:22 种机器人形态、约 100 万条轨迹, 展示了跨硬件迁移的潜力——没有 OXE,后来的 OpenVLA、Octo、π0 都难以起步22

π 系列(Physical Intelligence)的代表 π0(2024 年 10 月)用了很有意思的双层架构: 视觉-语言骨干用开源 PaliGemma(约 30 亿参数),管「看懂」;动作专家(约 3 亿参数)挂在后面, 用流匹配生成连续动作,每秒几十次——慢思考和快反应分开,书里叫它「大脑 + 小脑」式结构23。 公开演示里同一个模型完成过折衣服、叠毛巾、整理餐具、组装纸盒、擦桌子—— 机器人策略开始从「一事一训」走向「一模多用」24。折衣服是公认难题(柔性、形状不定、要皱), π0 展示了从演示数据学出可复用动作模式的潜力;后续工作把目标推向「换个地方也能做」, 在陌生公寓执行简单家务——成功率还不让人放心,但方向关键: 家庭机器人最难的,是在你家那个椅子永远不在原位、袜子永远找不到另一只的环境里还能不崩溃25。 π0.5 再进一步做层次化:高层语言模型规划子目标(每几秒更新),低层策略执行动作(每几十毫秒更新)—— 多时间尺度的分层设计借鉴了人脑:「决定去倒杯水」和控制手指抓杯,走的是完全不同的神经回路26

书里还给这波热潮泼了恰到好处的冷水:所谓「机器人领域的 GPT 时刻」更多还是愿景—— GPT 试错一段提示词几乎零成本,机器人每折一次衣服都在消耗真实的电机寿命和人工监督; 验收它的不是榜单分数,而是同一台机器连续上岗三个月、换三个没见过的房间,还能把碟子稳稳放进水槽27

8. 开源与闭源两条路线

2024–2025 的 VLA 生态明显分叉。开源侧:OpenVLA(70 亿参数,基于 Llama,在 OXE 约 97 万条轨迹上训练, 支持高效微调和低比特部署)、Octo(约 9300 万参数的紧凑模型,扩散动作头,能动态适配新机器人的接口, 适合当「机器人策略的起点」)、π 系列的 openpi 代码库,以及中国的 RDT-1B(清华,12 亿参数双臂模型, 扩散 Transformer 动作头,46 个公开数据集约一百万条轨迹预训练,瞄准中文指令和本地硬件)28闭源侧:DeepMind 的 Gemini Robotics 把视觉、语言、物理动作接进同一条模型链,甚至把显式思考、 规划和工具调用接入 VLA 执行链;Figure 的 Helix 用「双系统」——慢而强的系统 2 理解指令, 快而专的系统 1 实时控制运动(与 π0 的分层思路相通)29

书里给的平衡判语:开源决定了多少人能上手做研究,闭源展示了能力上限可能被推到哪里; 两条线短期内持续并行。还有一句给所有观众的提醒:厂商演示往往展示最好的一面, 看这类视频时,最好在心里默默问一句——失败样本在哪里?30

9. 世界模型:让机器人学会想象

机器人做动作前,脑子里能不能先「过一遍」?人做事时几乎不自觉地预演: 要不要拿那个杯子,脑内先模拟会不会碰到书。系统动力学奠基人福雷斯特 1971 年就说过: 我们脑子里装的那个「世界」只是一个模型——没有谁真的把整个世界塞进脑袋,我们只选了一些概念和它们的关系31

世界模型(World Model)是它在机器学习里的对应物:一个神经网络,输入「当前状态 + 动作」, 输出「下一状态」。有了它,机器人可以在想象里尝试各种动作组合、预测结果、选最优的, 而不用每次都在真实世界里试32。三条路线33:

  • Dreamer 系列(DeepMind):先学世界模型,然后完全在世界模型里训练策略——真实机器人只提供少量数据, 大部分训练发生在模型的「梦境」里。Dreamer V3 用同一套超参数训成 150 多种任务, 包括《我的世界》里从头采钻石这个长期里程碑——过去强化学习从未做到,因为任务链太长、奖励太稀疏, Dreamer 靠脑内演习攻克了它。它证明:好的世界模型能显著提高样本效率—— 同一台机器人,可以把更多练习转移到安全便宜的脑内演习里34;
  • 视频世界模型:NVIDIA Cosmos 用海量驾驶、机器人、操作视频学生成未来片段,用于数据增强和策略评估; Genie 从无标注游戏视频里学出「潜动作」,不用人工标注就能得到可控的世界。 但书里提醒:物理引擎擅长精确守恒,生成式模型擅长视觉丰富性,未来更可能是互补而非取代; 游戏里的杯子不会真碎,现实中的会,而且碎完还要扫地35;
  • JEPA(LeCun 长期推动):预测未来不该在像素层面,该在语义层面—— 精确预测下一帧的每个像素不可能(叶子怎么动无法预测),但预测「人走了一步、杯子倒了」完全可以。 跳过无意义的像素细节,专注有意义的抽象结构;LeCun 也多次批评单纯依赖大语言模型的路线, 这个判断有争议,但足以看出世界模型在他心中的地位36

世界模型的三个用途:想象中训练(Dreamer 式做梦,提样本效率)、想象中规划(走一步想十步)、 想象中评估(候选动作上线前先在模型里跑一遍,当安全过滤器)。边界也很清楚: 短时间尺度(几秒)预测不错,长时间尺度会累积漂移;分布内准确,外推到陌生场景出错。 书里给了合流预期:VLA 负责「我想做什么」,世界模型负责「如果这么做会怎样」37。 第 08 章留下的那半页机器人与音画重叠,也在此收口:机械臂接触物体的瞬间, 声音比视觉更早报警——那是多模态校验在物理世界的样子。

10. 为什么一定要做人形

工程上,做人形是「又笨又诱人」的办法:两条腿的行走能耗比轮子大,十几自由度的灵巧手比简单夹爪难训得多, 双足平衡控制是机器人学里的经典「珠峰」。那为什么许多公司仍铆足劲奔着人形去?38

答案藏在你身边的每个角落:门把手的高度、楼梯踏步的尺寸、电梯按钮的位置、冰箱里一盒牛奶的重量—— 这些数字是几千年来按成年人尺寸沉淀下来的默认值。我们把整个文明按自己的体型捏了个遍, 现在要让机器人进来打杂,一个很直接的办法就是让它也长成人形39。 反过来看历史更清楚:Roomba 只能扫地、达芬奇手术机绑在手术台上、Kiva 离不开二维码地板—— 每一种非人形方案都「专为某件事设计」,换个场景难复用。 人形的卖点不在省电、不在便宜,在于尽量适应已经为人类设计好的世界40。 当然代价惊人:双足行走从 WABOT-1(1973)到 ASIMO(2000)再到液压 Atlas(2010 年代), 每一代都是多年心血;直到近几年三股潮流汇合——电动关节和传感器降价、 大规模并行强化学习让步态训练更高效、VLA 让「怎么用身体完成任务」第一次可以大规模数据驱动41

11. 台前的公司在做什么

用 2026 年前后的口径,书里把进展分成三层,这个分层本身就是防炒作的42:

状态
工厂与仓库的受控试点Figure 02(宝马 Spartanburg 及莱比锡)、Optimus、Apollo(梅赛德斯)、Digit相对固定工位积累数据,从几周测试走向更长班次
家庭与通用服务的早期探索1X NEO(针织布外壳,「不吓到家里的奶奶」)、Helix、π 系列预订、等待名单、远程监督、小范围测试
开发者平台与研究样机宇树 G1(开发者版约 1.6 万美元)、H1让高校实验室买得起真实人形平台

书里对特斯拉那段的措辞尤其克制:AI Day 上演员假扮 Optimus 跳舞曾被当成段子, 但后续工程迭代是真实的;部分演示被说明或质疑含遥操作成分——机器人演示常常混合自主、半自主和人工遥控, 普通观众很难从视频里分辨;「年内造若干千台」是目标口径,不是已完成的商业事实43。 总结句:赛道从「能不能演示」进入了「能不能长期试点、能不能便宜维护、能不能安全交付」的阶段—— 机器人演示视频从来不缺,真正缺的是能每天上班、不闯祸、坏了有人修的产品44

12. 硬件、仿真与真机迁移

硬件:传感器让它感知(摄像头、激光雷达、力/触觉/惯性传感器),执行器让它行动(电机、关节、夹爪、灵巧手)。 近年扭矩密度提升、灵巧手逼近人手(5 指、16+ 自由度)、触觉分辨率改善; 成本下降让实验室买得起——但**「买得起硬件」不等于「用得起机器人」**,维护、训练、备件、保险、 远程监控和安全认证都会继续花钱45

仿真是训练场:真实机器人摔跤会坏、一天只能采几小时数据;现代仿真器能以数千倍于真实时间的速度运行, 原本要训几十年的任务几天训完。主流平台各有所长:Isaac Sim/Lab 偏规模和视觉逼真 (成千上万个虚拟机器人同时摔跤爬起——真机摔一次修半天,仿真摔一万次只让显卡风扇多转一会儿); MuJoCo 偏接触动力学精度(OpenAI 训练机械手还原魔方用的就是它);Genesis 偏速度和多物理统一; SAPIEN 专注抽屉柜门这类关节物体46。书里的谨慎照例到位:仿真越快越好,但快不等于真—— 如果仿真里的毛巾像木板一样听话,机器人在现实里叠衣服还是会被现实教育47

Sim-to-Real 迁移四招,常组合使用48: 域随机化(仿真里故意让纹理、光照、摩擦、重量大范围随机,策略被迫鲁棒——OpenAI 魔方随机化了数百个参数); 残差策略(仿真训基础策略,真机只学一个小的「修正量」,几百条真机数据就够,实验室用得起); 数据混合(仿真给量、真实给质,真实演示是锚、仿真是海量填充); 系统辨识(先用真机数据拟合仿真器参数,先校准再训练)。以人形学走路为例的整套组合拳: 系统辨识调仿真器 → 域随机化海量训练 → 少量真机微调——背后没有神奇公式, 是仿真、随机化、强化学习和工程调参一起发力49

13. 触觉:机器人的皮肤

传统机器人只有「眼睛」没有「皮肤」:不知道摸到了什么、力有多大、滑不滑。 人能闭着眼睛从口袋里摸出钥匙,因为有触觉;机器人没有触觉就做不到50

近年触觉传感器飞跃:GelSight(MIT)在柔软凝胶上印纹理、背面微型摄像头看形变, 能测出接触表面的 3D 形状,分辨率比人指尖还高(0.1 毫米量级);DIGIT(Meta)把它小型化成可量产的开源传感器; 清华 9DTact 一颗传感器同时测 3D 形状和六维力矩51。 有了触觉,任务面立刻扩了:插 USB(靠手感,视觉常被遮挡)、拧瓶盖(感受是否拧紧)、 剥鸡蛋壳、抓脆弱物品(捏太轻掉、捏太重碎)——很多这类任务不用复杂算法, 只要把触觉信号喂给 VLA 模型就有明显提升52

但触觉也是「通用机器人」的关键短板:视觉和语言都有海量互联网数据可预训练,触觉数据还很稀缺。 怎么大规模采集、怎么跨传感器迁移、怎么和视觉语言统一进 VLA,都是活跃方向; Meta 的 Sparsh、UniTouch 在尝试「触觉版的 ImageNet 预训练」53

14. 真机实验:从示教到部署

ALOHA(斯坦福,2023)是数据民主化的标志:总成本约 2 万美元的双臂遥操作系统, 操作者像牵木偶一样带动机械臂,机器人忠实复现。它的贡献不在硬件,而在把「采集机器人数据」的成本 从几十万降到几万;配套的 ACT 模型用较少演示学会穿线、折毛巾这类精细双手任务54。 Mobile ALOHA 加了个移动底座,演示视频里机器人学会炒虾、洗锅、用电梯,一度刷屏—— 但书里提醒:演示视频不是商品说明书,厨房台面、锅具、光照换一换,难度立刻上升55。 ALOHA 的深层意义:数据是最大的护城河之一——人类写一句话很便宜, 机器人倒一次水可能要一整套设备陪它练56

工厂是第一批试验田,因为任务相对结构化、收益可估算、失败成本可控。Figure 02 在宝马做钣金件操作, 从几周测试推进到更长班次;意义在于把机器人从实验室搬到生产线,让模型面对真实节拍和真实长尾—— 同时距离大规模替代工人还很远57。特斯拉 Optimus 的量产数字是目标口径; Apollo 走保守路线,先做成「好用的工具」再引入 AI 决策58

双足与灵巧手的两块里程碑:OpenAI 2019 年的机械手还原魔方证明了精细操作可学, 但也展示了另一件事——这种能力极其昂贵,学习方法只是把难题从「手写规则」转移到了「数据、仿真和算力」上59。 运动能力很大程度来自大规模并行强化学习:Isaac 里同时跑大量机器人、PPO 训练、域随机化迁移; 还有一个精妙的教师-学生蒸馏:先训一个能看到「上帝视角信息」(地形、摩擦系数)的教师策略, 再训只看传感器信息的学生来模仿——像学骑车,教练一开始扶着你,最后你上路时看不到教练, 但身体已经学会了平衡60

家庭是最难的考场:环境非结构化、安全要求高——机器人在工厂犯错,通常是停线和返工; 在家里犯错,可能是把热汤洒到孩子身上61。当前常见的系统方案是「大脑和身体分离」: 云端大模型拆解「帮我准备晚餐」,本地小模型实时执行每一步——慢思考与快反应各司其职62

15. 挑战:四道硬约束加一道伦理题

安全是首要问题:一个幻觉的聊天机器人顶多说错话,一个误判的家庭机器人可能撞到人、伤到宠物、毁掉物品。 需要多层保障——硬件的力限制和柔顺关节、软件的紧急停止和动作边界、AI 的不确定性估计和人类确认、 法律的责任界定和保险。书里给了一条实用原则:机器人越靠近人,动作就越要慢、力就越要小、权限就越要低—— 能搬发动机的机器人,不应该在儿童房里用同样的速度挥胳膊63

可靠性还是那个指数衰减的算术:每步 99% 成功率,连续 100 步后整体只剩约 36.6%—— 家务任务动辄几十上百步。这正是第 13 章「失败恢复」在物理世界的对应物: 出错时机器人要能意识到、诊断、尝试替代方案。所以人类在环短期内很重要: 远程监督、不确定就请求接管,听起来不够酷,但务实——电梯刚发明时也需要电梯操作员64

成本:几万美元的硬件对工业可接受,对家庭仍奢侈;而且机器人不是买断式小家电, 像一辆会走路的汽车——保养、软件更新、备件、保险、订阅(持续付费的服务)都要钱。书里的黑色幽默: 如果每天都要你扶它、修它、重启它,那它就不是家务助手,是家里新来的电子祖宗65

数据稀缺:每条演示都要真机或专家遥控;而且数据不通 用——A 机械臂的数据未必能教 B 人形, 厨房数据未必适合病房。缓解方向:更强的仿真、从人类视频学动作先验、跨机器人迁移、 从多模态大模型复用(只重点训「动作」那部分)66

伦理与社会:家用机器人会看到家里所有事情(隐私)、做错事谁负责(责任)、替代哪些岗位(就业)、 以及在机器人服务下长大的孩子会不会连基本家务也不会做(依赖)——没有标准答案, 机器人时代来临前能多想一步,总好过等到问题爆发才被动应对67

书里的收束把具身放回了全书主线:身体带来的不止是能力延伸,它在悄悄改写我们对「智能」的定义—— 婴儿摇晃杯子学惯性、用手抓冰学冷,身体不是智能的附属品,而是智能的一部分; 这或许解释了为什么没有身体的大模型再聪明,也对「杯子会不会倒」偶尔犯糊涂68。 而具身是不是 AGI 的必要条件,书里留给两派:LeCun 一派认为没有身体就没有稳固常识, 另一派认为足够强的模型可以从视频和仿真推断物理规律——两种观点可能都对,AGI 可能有多条路径, 其中具身是一条(第 18 章正面处理)69

主走查:把桌上的红杯子放进水槽

这条走查贯穿本章。 输入:一句「把桌上的红杯子放进水槽」,桌上有一只红塑料杯、一只白瓷杯、 一本挡在中间的书(场景为演示设定)。跟一台 VLA 机械臂走完整个闭环。

① 一帧画面进视觉编码器。(§5 §12) 摄像头图像被切成视觉词元(第 08 章的三模块结构在机器人身上的复用), 和「把红杯子放进水槽」的语言词元一起排进同一条序列——VLA 的输入端。

② 模型输出未来 50 步动作。(§6 §7) 动作分块:模型一次预测未来 50 步的连续关节量(π0 的做法),而不是一步一步猜—— 伸手、绕过书、张合夹爪,是一条连贯的「计划书」;若用扩散动作头, 「从书的左边绕还是右边绕」这种多解情形也能自然表达(§6 的多峰分布)。

③ 接触瞬间,触觉报警打滑。(§3 §13) 夹爪合拢碰到杯壁的刹那,摩擦、弹性、微小滑动同时到场——「接触是一场临时谈判」。 触觉传感器测到剪切力异常(演示设定:滑移信号超阈值),反馈进模型:它没有硬拽, 而是加大握力、放缓速度重抓——视觉看不到的「快滑了」,皮肤知道。

④ 走到水槽前,世界模型先预演。(§9) 放下之前,世界模型在脑内跑了一遍「松爪会怎样」:预测杯子落点在水槽内、溅水范围可接受—— 「想一下再做」的安全过滤器,减少危险动作直接落到真实硬件上的机会。

⑤ 放下,闭环完成。(§1 §15) 杯子入槽。整条链的可逆性设计一览无余:抓取可重试、路径可重规划、 放下前有预演——物理世界里没有「撤销」键,所以第 11 章的「可逆动作优先」在这里变成了 「每一步都先想清楚」。

⑥ 一组参照数字收尾。(§15) 假设单步成功率 99%(书里的口径),这条 8 步任务的整体成功率约 92%(演示计算); 而一个 100 步的整理厨房任务只剩约 36.6%(书里的数)——这就是家务比工厂难一个数量级的算术, 也是远程监督短期不可少的原因

作者的判断与证据

书里给出可核事实或文献来源的地方:

  • RT-1 的 13 台机械臂、17 个月、13 万次演示、700+ 任务、3500 万参数;RT-2 的底座(PaLI-X 55B / PaLM-E 12B) 与「灭绝的动物」案例;Open X-Embodiment 的 34 家机构、22 种形态、约 100 万条轨迹——均出自对应论文192022;
  • π0 的双结构(PaliGemma 约 3B 骨干 + 约 0.3B 动作专家,流匹配)与折衣服演示,出自其技术报告23;
  • OpenVLA(7B、Llama、OXE 约 97 万轨迹)、Octo(约 93M、扩散动作头)、RDT-1B(1.2B、双臂、46 数据集) 的参数与数据口径,均与论文一致28;
  • Dreamer V3 同一套超参数训 150+ 任务、《我的世界》采钻石;GelSight 0.1 毫米量级分辨率; ALOHA 约 2 万美元成本;每步 99%×100 步≈36.6%——书内给出的具体数字34515464;
  • 宝马 Spartanburg 工厂试点、特斯拉遥操作争议、2025 财报口径——书里逐一标注了「试点非替代」和「目标非事实」43

书里标成判断或立场的地方:

  • 「VLA + 世界模型可能合流:VLA 负责我想做什么,世界模型负责如果这么做会怎样」——作者的展望37;
  • 「人形是少改造环境的下注,卖点不在省电便宜」——作者的工程判断39;
  • LeCun 的「没有身体就没有稳固常识」与反对派观点——书里明确写成两派争议,不下结论69;
  • 「机器人领域的 GPT 时刻更多还是愿景」——作者的克制判断,理由是试错成本27

判断(我们的,不是书里的): 本章四种动作表示(词元化/分块/扩散/流匹配)的演化, 和第 07 章推理模型的演化撞在了同一个词上——「把预算从逐步决策挪到一次多步」。 动作分块是大模型出计划书、本地快执行;长思维链是回答前多想、输出时干净。 两者的共同底层是:自回归逐 token 的接口对「连续、连贯、低延迟」的任务都不友好, 于是两边各自长出了「一次生成一段」的结构。据此我们预判:VLA 的「系统 2/系统 1」分层 (Helix、π0.5)会吸收推理模型的显式思考机制——书里在 Gemini Robotics 一段已经埋了 「把显式思考接入 VLA 执行链」这句话,这条线会继续长。 如果错,会错在: 若高频控制端的算力和流匹配类方法进步到「端到端一次生成即可又快又稳」, 分层就失去必要性——那对分层设计的价值判断要重写;书里对这条线的走势未给时间表。

边界与局限

  • 对应关系: 本章对应原书第 14 章全文。第 08 章音频一节埋的「机器人夹爪接触声」按约定在本章 §9 收口;第 01 章的「三岁小孩」伏笔在 §2 兑现。
  • 没展开的: 各仿真器的安装与使用细节、人形机器人的人体工程学设计、Agility Digit 的仓储细节、医疗照护赛道只留一段;DAL 等更新一代模型的后续未覆盖(书成稿时点限制)。
  • 数字的诚实声明: 人形机器人成本曲线书里明确标注「概念性趋势,数字为媒体估算或厂商目标,非官方成交价」;Optimus 的产能口径书里反复强调是目标而非事实——本组拆解全部继承这些限定。
  • 时效性: Helix、π0.5、9DTact、Sparsh 均为 2024–2025 的工作;这条赛道月度都在变,骨架(范式、表示、迁移方法)比型号耐放。

可带走的

  1. 摩拉维克悖论一句话:对机器而言,下棋容易、抓杯子难——后者是几十亿年演化打磨出来的感知与控制。
  2. 经典三支柱在结构化环境很好用,开放环境里规则写不完;接触是一场临时谈判——Shakey 的教训是计划总会被世界打断。
  3. RL 机器人的死穴是样本效率,三条解药:sim-to-real、演示学习、预训练加微调。
  4. VLA 的关键洞察:世界知识(万亿词元)和操作技能(百万条轨迹)分开积累、合起来用;但继承来的常识是纸面常识,要接受物理世界的考试。
  5. 动作表示四选一:词元化(语言绑定)、分块(连贯省算)、扩散(多峰多解)、流匹配(高频连续);π0 的大脑加小脑按时间尺度分层,借鉴人脑。
  6. 世界模型三用途:想象中训练、想象中规划、想象中评估;JEPA 不预测像素,只预测意义——「人走了一步」可以预测,叶子怎么动不行。
  7. 人形是「少改造环境」的下注:整个文明按成年人尺寸捏的;卖点是适应人类世界,不是省电便宜。
  8. 仿真摔一万次只费电;触觉是通用机器人的短板——域随机化、残差策略、数据混合、系统辨识组合打 Sim-to-Real,触觉数据却要一颗颗传感器采。
  9. 演示视频不是商品说明书:混合自主与遥操作观众分不清,验收标准是连续上岗三个月。
  10. 可靠性指数衰减,机器人越靠近人,动作越要慢、力越小、权限越低——买得起硬件不等于用得起机器人,否则它是「电子祖宗」。

原文地图

主题原书节原文位置
宝马试点开场14 引言text/15-ch14.txt:8(搜“放入夹具”) · text/15-ch14.txt:11(搜“严肃地”)
物理世界的麻烦14 引言text/15-ch14.txt:17(搜“摩擦、重力、惯性、磨损”)
没有身体14.1text/15-ch14.txt:31(搜“没有手、没有身体”) · text/15-ch14.txt:36(搜“杯子”)
具身智能定义14.1text/15-ch14.txt:40(搜“Embodied Intelligence”) · text/15-ch14.txt:43(搜“空转”)
升温与怀疑14.1text/15-ch14.txt:47(搜“ChatGPT 装上轮子”)
摩拉维克悖论14.1text/15-ch14.txt:49(搜“摩拉维克悖论”) · text/15-ch14.txt:52(搜“半睡半醒”)
三支柱14.2.1text/15-ch14.txt:59(搜“三个支柱”) · text/15-ch14.txt:65(搜“PID 控制器”) · text/15-ch14.txt:69(搜“规则根本写不完”)
Shakey14.2.1text/15-ch14.txt:72(搜“Shakey”) · text/15-ch14.txt:77(搜“猫把它叼走了”)
大象不下棋14.2.1text/15-ch14.txt:78(搜“行为式机器人学”) · text/15-ch14.txt:80(搜“地基”)
接触难点14.2.1text/15-ch14.txt:82(搜“临时谈判”) · text/15-ch14.txt:83(搜“拧瓶盖看起来简单”)
RL 样本效率14.2.2text/15-ch14.txt:91(搜“样本效率太低”) · text/15-ch14.txt:92(搜“摔跤会坏”)
三条突破14.2.2text/15-ch14.txt:94(搜“sim-to-real”) · text/15-ch14.txt:96(搜“演示学习”) · text/15-ch14.txt:98(搜“预训练加微调”)
VLA 定义14.3.1text/15-ch14.txt:105(搜“Vision-Language-Action Model”) · text/15-ch14.txt:113(搜“同一个模型里”)
接口打通14.3.1text/15-ch14.txt:118(搜“已经被打通”)
知识与技能分开14.3.1text/15-ch14.txt:119(搜“分开积累、合起来使用”) · text/15-ch14.txt:121(搜“几百万条”)
动作词元化14.3.2text/15-ch14.txt:143(搜“Action Tokenization”) · text/15-ch14.txt:144(搜“256 个格子”)
动作分块14.3.2text/15-ch14.txt:148(搜“Action Chunking”) · text/15-ch14.txt:153(搜“大模型出“计”) · text/15-ch14.txt:156(搜“50 到 100 步动作”)
扩散动作头14.3.2text/15-ch14.txt:157(搜“扩散动作头”) · text/15-ch14.txt:160(搜“平均答案”) · text/15-ch14.txt:161(搜“Diffusion Policy”)
流匹配14.3.2text/15-ch14.txt:163(搜“Flow Matching”) · text/15-ch14.txt:165(搜“𝜋0”)
演化主线14.3.2text/15-ch14.txt:167(搜“从把动作当语言到把动作当分布”) · text/15-ch14.txt:170(搜“没有一个统一答案”)
RT-114.3.3text/15-ch14.txt:176(搜“13 万次演示”) · text/15-ch14.txt:177(搜“3500 万参数”) · text/15-ch14.txt:180(搜““自然语言是机器”)
RT-214.3.3text/15-ch14.txt:183(搜“PaLI-X 55B”) · text/15-ch14.txt:184(搜“灭绝的动物”) · text/15-ch14.txt:195(搜“物理世界的考试”)
OXE14.3.3text/15-ch14.txt:196(搜“34 家机构”) · text/15-ch14.txt:198(搜“100 万条轨迹”) · text/15-ch14.txt:201(搜“很难起步”)
Gemini Robotics14.3.3text/15-ch14.txt:203(搜“显式”) · text/15-ch14.txt:206(搜“安全边界的考验”)
π0 双层14.3.4text/15-ch14.txt:213(搜“PaliGemma”) · text/15-ch14.txt:216(搜““大脑 + 小脑””)
一模多用14.3.4text/15-ch14.txt:232(搜“折叠衣服”) · text/15-ch14.txt:234(搜““一模多用””)
陌生环境14.3.4text/15-ch14.txt:246(搜“不崩溃”)
π0.5 分层14.3.4text/15-ch14.txt:249(搜“每几十毫秒更新一次”) · text/15-ch14.txt:251(搜“神经回路”)
GPT 时刻的冷水14.3.4text/15-ch14.txt:257(搜“便宜的试错”) · text/15-ch14.txt:258(搜“三个月”)
OpenVLA/Octo/RDT14.3.5text/15-ch14.txt:262(搜“OpenVLA”) · text/15-ch14.txt:267(搜“Octo”) · text/15-ch14.txt:272(搜“RDT-1B”)
Helix 双系统14.3.5text/15-ch14.txt:280(搜“双系统架构”) · text/15-ch14.txt:282(搜“失败样本在哪里”)
开闭源分叉14.3.5text/15-ch14.txt:291(搜“开源决定了多少人能”) · text/15-ch14.txt:292(搜“持续并行”)
世界模型直觉14.4text/15-ch14.txt:303(搜“脑子里装的那个“世界”只是一个模”) · text/15-ch14.txt:311(搜“World Model”)
Dreamer14.4.1text/15-ch14.txt:323(搜“Dreamer”) · text/15-ch14.txt:327(搜“150 多种不同任务”) · text/15-ch14.txt:334(搜““脑内演习””)
视频世界模型14.4.2text/15-ch14.txt:340(搜“Cosmos”) · text/15-ch14.txt:347(搜“互补”) · text/15-ch14.txt:348(搜“Genie”) · text/15-ch14.txt:353(搜“碎完还要扫地”)
安全过滤器14.4.2text/15-ch14.txt:356(搜““想一下再做””)
JEPA14.4.3text/15-ch14.txt:361(搜“JEPA”) · text/15-ch14.txt:366(搜“抽象结构”) · text/15-ch14.txt:370(搜“有争议”)
三用途与边界14.4.4text/15-ch14.txt:374(搜“想象中训练”) · text/15-ch14.txt:378(搜“不能替代真实测试”) · text/15-ch14.txt:380(搜“累积漂移”) · text/15-ch14.txt:386(搜“如果这么做会怎样”)
人形的笨与诱人14.5.1text/15-ch14.txt:409(搜“又笨又诱人”) · text/15-ch14.txt:410(搜“珠峰”)
按成年人捏的世界14.5.1text/15-ch14.txt:414(搜“默认值”) · text/15-ch14.txt:414(搜“捏了个遍”)
非人形的历史14.5.1text/15-ch14.txt:418(搜“Roomba”) · text/15-ch14.txt:423(搜“已经为人类设计好的世界”)
三股潮流汇合14.5.1text/15-ch14.txt:429(搜“三股技术潮流”) · text/15-ch14.txt:432(搜“还没有完全发生”)
三层进展14.5.2text/15-ch14.txt:498(搜“三类”) · text/15-ch14.txt:504(搜““能不能演示”进入了”)
Optimus 口径14.5.2text/15-ch14.txt:443(搜“紧身衣”) · text/15-ch14.txt:446(搜“不是已经兑现的现实”)
遥操作成分14.7.2text/15-ch14.txt:712(搜“遥操作成分”) · text/15-ch14.txt:717(搜“目标口径”)
演示视频从来不缺14.5.2text/15-ch14.txt:497(搜“不闯祸、坏了有人修”)
硬件14.6.1text/15-ch14.txt:549(搜“16+ 自由度”) · text/15-ch14.txt:554(搜“用得起机器人”)
仿真器14.6.2text/15-ch14.txt:558(搜“数千倍于真实时”) · text/15-ch14.txt:564(搜“显卡风扇多转一会儿”) · text/15-ch14.txt:565(搜“MuJoCo”) · text/15-ch14.txt:579(搜“同时用几个”)
快不等于真14.6.2text/15-ch14.txt:571(搜“快不等于真”)
域随机化14.6.3text/15-ch14.txt:588(搜“域随机化”) · text/15-ch14.txt:592(搜“数百个参数”)
残差与混合与辨识14.6.3text/15-ch14.txt:594(搜“残差策略学习”) · text/15-ch14.txt:597(搜“几百条就够”) · text/15-ch14.txt:601(搜“海量填充”) · text/15-ch14.txt:602(搜“系统辨识”)
组合拳14.6.3text/15-ch14.txt:608(搜“组合拳”) · text/15-ch14.txt:610(搜“一起发力”)
触觉传感器14.6.4text/15-ch14.txt:612(搜““皮肤””) · text/15-ch14.txt:617(搜“GelSight”) · text/15-ch14.txt:621(搜“0.1 毫米量级”) · text/15-ch14.txt:622(搜“9DTact”)
触觉扩展任务14.6.4text/15-ch14.txt:624(搜“插 USB 接口”) · text/15-ch14.txt:626(搜“捏太重碎”)
触觉数据稀缺14.6.4text/15-ch14.txt:628(搜“关键短板之一”) · text/15-ch14.txt:630(搜“Sparsh”)
ALOHA14.7.1text/15-ch14.txt:680(搜“2 万美元”) · text/15-ch14.txt:683(搜“从几十万降到了几万”) · text/15-ch14.txt:695(搜“数据是最大的护城河”) · text/15-ch14.txt:698(搜“倒一次水”)
Mobile ALOHA14.7.1text/15-ch14.txt:690(搜“演示视频不是商品说明”)
工厂试验14.7.2text/15-ch14.txt:704(搜“宝马工厂是一个标志”) · text/15-ch14.txt:707(搜“很长距离”)
魔方14.7.3text/15-ch14.txt:736(搜“调可以通过学习方法逼近”) · text/15-ch14.txt:739(搜“数据、仿真和算力”)
双足与蒸馏14.7.4text/15-ch14.txt:763(搜“大规模并行强化学习”) · text/15-ch14.txt:768(搜“教师-学生蒸馏”) · text/15-ch14.txt:774(搜“学骑车”)
家庭之难14.7.5text/15-ch14.txt:67(搜“非结构化”) · text/15-ch14.txt:794(搜“离商品落地还有距离”)
混合方案14.7.6text/15-ch14.txt:797(搜“大脑和身体分离”)
安全14.8.1text/15-ch14.txt:817(搜“撞到人、伤到宠物”) · text/15-ch14.txt:821(搜“越靠近人”) · text/15-ch14.txt:822(搜“儿童房”)
可靠性14.8.2text/15-ch14.txt:826(搜“36.6%”) · text/15-ch14.txt:831(搜“电梯操作员”)
成本14.8.3text/15-ch14.txt:835(搜“会走路的汽车”) · text/15-ch14.txt:841(搜“电子祖宗”)
数据稀缺14.8.4text/15-ch14.txt:844(搜“稀缺得多”) · text/15-ch14.txt:846(搜“未必能直接给 B”)
伦理14.8.5text/15-ch14.txt:857(搜“隐私”) · text/15-ch14.txt:863(搜“被动应对”)
AGI 两派14.9text/15-ch14.txt:881(搜“LeCun”) · text/15-ch14.txt:888(搜“多条路径”)
身体是智能的一部分14.10text/15-ch14.txt:906(搜“智能的一部分”) · text/15-ch14.txt:908(搜“偶尔犯糊涂”)

Footnotes

  1. 出处:「14.1」第 31 段(text/15-ch14.txt:31,搜“没有手、没有身体”)。

  2. 出处:第 35 段(text/15-ch14.txt:35,搜“物理世界生存演化”)、第 40 段(text/15-ch14.txt:40,搜“Embodied Intelligence”)、第 43 段(text/15-ch14.txt:43,搜“空转”)。

  3. 出处:第 47 段(text/15-ch14.txt:47,搜“ChatGPT 装上轮子”)。

  4. 出处:第 49 段(text/15-ch14.txt:49,搜“摩拉维克悖论”)与第 51 段(text/15-ch14.txt:51,搜“几十亿年演化打磨”)。

  5. 出处:第 52 段(text/15-ch14.txt:52,搜“半睡半醒”)。

  6. 出处:「14.2.1」第 59 段(text/15-ch14.txt:59,搜“三个支柱”)、第 65 段(text/15-ch14.txt:65,搜“PID 控制器”)。

  7. 出处:第 69 段(text/15-ch14.txt:69,搜“规则根本写不完”)。

  8. 出处:第 72 段(text/15-ch14.txt:72,搜“Shakey”)与第 77 段(text/15-ch14.txt:77,搜“猫把它叼走了”)。

  9. 出处:第 78 段(text/15-ch14.txt:78,搜“行为式机器人学”)与第 80 段(text/15-ch14.txt:80,搜“地基”)。

  10. 出处:第 82 段(text/15-ch14.txt:82,搜“临时谈判”)与第 83 段(text/15-ch14.txt:83,搜“拧瓶盖看起来简单”)。

  11. 出处:「14.2.2」第 91 段(text/15-ch14.txt:91,搜“样本效率太低”)。

  12. 出处:第 94 段(text/15-ch14.txt:94,搜“sim-to-real”)、第 96 段(text/15-ch14.txt:96,搜“演示学习”)、第 98 段(text/15-ch14.txt:98,搜“预训练加微调”)。

  13. 出处:「14.3.1」第 105 段(text/15-ch14.txt:105,搜“Vision-Language-Action Model”)与第 113 段(text/15-ch14.txt:113,搜“同一个模型里”)。

  14. 出处:第 119 段(text/15-ch14.txt:119,搜“分开积累、合起来使用”)。

  15. 出处:第 121 段(text/15-ch14.txt:121,搜“几百万条”)与第 118 段(text/15-ch14.txt:118,搜“已经被打通”)。

  16. 出处:「14.3.2」第 141 段(text/15-ch14.txt:141,搜“动作该怎么表示”)。

  17. 出处:第 143 段(text/15-ch14.txt:143,搜“Action Tokenization”)、第 144 段(text/15-ch14.txt:144,搜“256 个格子”)、第 148 段(text/15-ch14.txt:148,搜“Action Chunking”)、第 156 段(text/15-ch14.txt:156,搜“50 到 100 步动作”)、第 157 段(text/15-ch14.txt:157,搜“扩散动作头”)、第 163 段(text/15-ch14.txt:163,搜“Flow Matching”)。

  18. 出处:第 167 段(text/15-ch14.txt:167,搜“从把动作当语言到把动作当分布”)。

  19. 出处:「14.3.3」第 176 段(text/15-ch14.txt:176,搜“13 万次演示”)、第 177 段(text/15-ch14.txt:177,搜“3500 万参数”)、第 180 段(text/15-ch14.txt:180,搜““自然语言是机器”)。 2

  20. 出处:第 183 段(text/15-ch14.txt:183,搜“PaLI-X 55B”)、第 184 段(text/15-ch14.txt:184,搜“灭绝的动物”)。 2

  21. 出处:第 195 段(text/15-ch14.txt:195,搜“物理世界的考试”)。

  22. 出处:第 196 段(text/15-ch14.txt:196,搜“34 家机构”)、第 198 段(text/15-ch14.txt:198,搜“100 万条轨迹”)、第 201 段(text/15-ch14.txt:201,搜“很难起步”)。 2

  23. 出处:「14.3.4」第 213 段(text/15-ch14.txt:213,搜“PaliGemma”)、第 216 段(text/15-ch14.txt:216,搜““大脑 + 小脑””)。 2

  24. 出处:第 232 段(text/15-ch14.txt:232,搜“折叠衣服”)、第 234 段(text/15-ch14.txt:234,搜““一模多用””)。

  25. 出处:第 246 段(text/15-ch14.txt:246,搜“不崩溃”)。

  26. 出处:第 249 段(text/15-ch14.txt:249,搜“每几十毫秒更新一次”)、第 251 段(text/15-ch14.txt:251,搜“神经回路”)。

  27. 出处:第 257 段(text/15-ch14.txt:257,搜“便宜的试错”)、第 258 段(text/15-ch14.txt:258,搜“三个月”)。 2

  28. 出处:「14.3.5」第 262 段(text/15-ch14.txt:262,搜“OpenVLA”)、第 267 段(text/15-ch14.txt:267,搜“Octo”)、第 272 段(text/15-ch14.txt:272,搜“RDT-1B”)。 2

  29. 出处:第 280 段(text/15-ch14.txt:280,搜“双系统架构”)与第 203 段(text/15-ch14.txt:203,搜“显式”)。

  30. 出处:第 282 段(text/15-ch14.txt:282,搜“失败样本在哪里”)、第 291 段(text/15-ch14.txt:291,搜“开源决定了多少人能”)。

  31. 出处:「14.4」第 303 段(text/15-ch14.txt:303,搜“脑子里装的那个“世界”只是一个模”)。

  32. 出处:第 311 段(text/15-ch14.txt:311,搜“World Model”)与第 312 段(text/15-ch14.txt:312,搜“下一状态”)。

  33. 路线划分综合自 14.4.1–14.4.3 三节。

  34. 出处:「14.4.1」第 323 段(text/15-ch14.txt:323,搜“Dreamer”)、第 327 段(text/15-ch14.txt:327,搜“150 多种不同任务”)、第 334 段(text/15-ch14.txt:334,搜““脑内演习””)。 2

  35. 出处:「14.4.2」第 340 段(text/15-ch14.txt:340,搜“Cosmos”)、第 347 段(text/15-ch14.txt:347,搜“互补”)、第 353 段(text/15-ch14.txt:353,搜“碎完还要扫地”)。

  36. 出处:「14.4.3」第 361 段(text/15-ch14.txt:361,搜“JEPA”)、第 366 段(text/15-ch14.txt:366,搜“抽象结构”)。

  37. 出处:「14.4.4」第 374 段(text/15-ch14.txt:374,搜“想象中训练”)、第 380 段(text/15-ch14.txt:380,搜“累积漂移”)、第 386 段(text/15-ch14.txt:386,搜“如果这么做会怎样”)。 2

  38. 出处:「14.5.1」第 409 段(text/15-ch14.txt:409,搜“又笨又诱人”)、第 410 段(text/15-ch14.txt:410,搜“珠峰”)。

  39. 出处:第 414 段(text/15-ch14.txt:414,搜“捏了个遍”)。 2

  40. 出处:第 418 段(text/15-ch14.txt:418,搜“Roomba”)、第 423 段(text/15-ch14.txt:423,搜“已经为人类设计好的世界”)。

  41. 出处:第 429 段(text/15-ch14.txt:429,搜“三股技术潮流”)、第 432 段(text/15-ch14.txt:432,搜“还没有完全发生”)。

  42. 出处:「14.5.2」第 498 段(text/15-ch14.txt:498,搜“三类”)、第 504 段(text/15-ch14.txt:504,搜““能不能演示”进入了”)。

  43. 出处:第 443 段(text/15-ch14.txt:443,搜“紧身衣”)、第 446 段(text/15-ch14.txt:446,搜“不是已经兑现的现实”)、「14.7.2」第 712 段(text/15-ch14.txt:712,搜“遥操作成分”)、第 717 段(text/15-ch14.txt:717,搜“目标口径”)。 2

  44. 出处:第 497 段(text/15-ch14.txt:497,搜“不闯祸、坏了有人修”)。

  45. 出处:「14.6.1」第 549 段(text/15-ch14.txt:549,搜“16+ 自由度”)、第 554 段(text/15-ch14.txt:554,搜“用得起机器人”)。

  46. 出处:「14.6.2」第 558 段(text/15-ch14.txt:558,搜“数千倍于真实时”)、第 564 段(text/15-ch14.txt:564,搜“显卡风扇多转一会儿”)、第 565 段(text/15-ch14.txt:565,搜“MuJoCo”)。

  47. 出处:第 571 段(text/15-ch14.txt:571,搜“快不等于真”)。

  48. 出处:「14.6.3」第 588 段(text/15-ch14.txt:588,搜“域随机化”)、第 594 段(text/15-ch14.txt:594,搜“残差策略学习”)、第 601 段(text/15-ch14.txt:601,搜“海量填充”)、第 602 段(text/15-ch14.txt:602,搜“系统辨识”)。

  49. 出处:第 608 段(text/15-ch14.txt:608,搜“组合拳”)、第 610 段(text/15-ch14.txt:610,搜“一起发力”)。

  50. 出处:「14.6.4」第 612 段(text/15-ch14.txt:612,搜““皮肤””)。

  51. 出处:第 617 段(text/15-ch14.txt:617,搜“GelSight”)、第 621 段(text/15-ch14.txt:621,搜“0.1 毫米量级”)、第 622 段(text/15-ch14.txt:622,搜“9DTact”)。 2

  52. 出处:第 624 段(text/15-ch14.txt:624,搜“插 USB 接口”)、第 626 段(text/15-ch14.txt:626,搜“捏太重碎”)。

  53. 出处:第 628 段(text/15-ch14.txt:628,搜“关键短板之一”)、第 630 段(text/15-ch14.txt:630,搜“Sparsh”)。

  54. 出处:「14.7.1」第 680 段(text/15-ch14.txt:680,搜“2 万美元”)、第 683 段(text/15-ch14.txt:683,搜“从几十万降到了几万”)。 2

  55. 出处:第 690 段(text/15-ch14.txt:690,搜“演示视频不是商品说明”)。

  56. 出处:第 695 段(text/15-ch14.txt:695,搜“数据是最大的护城河”)、第 698 段(text/15-ch14.txt:698,搜“倒一次水”)。

  57. 出处:「14.7.2」第 704 段(text/15-ch14.txt:704,搜“宝马工厂是一个标志”)、第 707 段(text/15-ch14.txt:707,搜“很长距离”)。

  58. 出处:第 719 段(text/15-ch14.txt:719,搜“好用的工具”)。

  59. 出处:「14.7.3」第 736 段(text/15-ch14.txt:736,搜“调可以通过学习方法逼近”)、第 739 段(text/15-ch14.txt:739,搜“数据、仿真和算力”)。

  60. 出处:「14.7.4」第 768 段(text/15-ch14.txt:768,搜“教师-学生蒸馏”)、第 774 段(text/15-ch14.txt:774,搜“学骑车”)。

  61. 出处:「14.7.5」第 67 段(text/15-ch14.txt:67,搜“非结构化”)与「14.5.3」第 520 段(text/15-ch14.txt:520,搜“热汤洒到孩子身上”)。

  62. 出处:「14.7.6」第 797 段(text/15-ch14.txt:797,搜“大脑和身体分离”)。

  63. 出处:「14.8.1」第 821 段(text/15-ch14.txt:821,搜“越靠近人”)、第 822 段(text/15-ch14.txt:822,搜“儿童房”)。

  64. 出处:「14.8.2」第 826 段(text/15-ch14.txt:826,搜“36.6%”)、第 831 段(text/15-ch14.txt:831,搜“电梯操作员”)。 2

  65. 出处:「14.8.3」第 835 段(text/15-ch14.txt:835,搜“会走路的汽车”)、第 841 段(text/15-ch14.txt:841,搜“电子祖宗”)。

  66. 出处:「14.8.4」第 844 段(text/15-ch14.txt:844,搜“稀缺得多”)、第 846 段(text/15-ch14.txt:846,搜“未必能直接给 B”)。

  67. 出处:「14.8.5」第 857 段(text/15-ch14.txt:857,搜“隐私”)、第 863 段(text/15-ch14.txt:863,搜“被动应对”)。

  68. 出处:「14.10」第 906 段(text/15-ch14.txt:906,搜“智能的一部分”)、第 908 段(text/15-ch14.txt:908,搜“偶尔犯糊涂”)。

  69. 出处:「14.9」第 881 段(text/15-ch14.txt:881,搜“LeCun”)、第 888 段(text/15-ch14.txt:888,搜“多条路径”)。 2