跳到主要内容

比赛长什么样,它属于哪门学问

这一章讲三件事: 这场比赛的场地、车和任务到底长什么样; 「人工智能」「机器学习」「深度学习」这几个被换着用的词是什么关系; 以及这本书为什么只讲其中一支。 它是全书的第 0 级台阶 —— 后面十五章都在回答本章最后那张施工图上的某一格。 不需要任何基础,遇到的生词都在当场解释。

1. 顶层全景:全书只在填一个空

先把这本书要干的事压成一张图。这张图后面每一章都会回来。

赛场:一块 600×480 厘米的布,上面画着一圈车道


车:四个电机,一个轮子一个;车头顶上一只朝前的摄像头

│ 摄像头拍下这一帧

一张 640×480 的彩色图

│ ← ← ← 全书十六章,全部是在填这一段 → → →

一个 −1 到 1 之间的小数 (负数往左打、正数往右打、0 走直线)


左右前轮的转速:要右转就右轮减速、左轮不变


车往右偏了一点。再拍下一帧,整条链从头再来一遍

图说:整条链上,只有中间那一段是难的。 两头都很朴素:摄像头拍图是现成的, 转角变成轮速也只是一句判断(第 02 章当场写给你看)。

这一章的主走查就是这条链。 下面每一节都会回到它: 第 2 节看赛场和车(链条的头),第 3 节看那一对数据(链条的中段), 第 4 节看这条链最后跑在什么硬件上,第 5 节看这条链其实有两条、不是一条。

2. 先看现场:这不是一个比喻

「智能车」这三个字很容易被当成大词。它不是。

它是一块 600 厘米 × 480 厘米的布,PU 材质或者喷绘布,平铺在地上。 换算一下:28.8 平方米,比一间标准教室的地面还小一点(教室面积是常识,不在书里)。 上面画着一圈车道,含黄线在内宽约 50 厘米 —— 大概是一张办公椅那么宽。 车从地图左下角出发,绕一圈,回到起点1

车是什么结构

┌─────────────────┐
│ 摄像头(朝前) │ ← 车上唯一的「眼睛」
├─────────────────┤
电机─┤ 左前轮 右前轮 ├─电机 ← 转向靠这两个轮子的转速差
│ │
电机─┤ 左后轮 右后轮 ├─电机 ← 这两个轮子可以横向摆动
└─────────────────┘

图说:四个电机各驱一个轮子,没有方向盘、没有转向舵机。
想右转,就把右前轮降速、左前轮不变——车自然就往右偏。

书里写的是:整个底盘四个电机分别驱动四个车轮;后轮用的是一种可以横向摆动的轮子; 转向靠前轮两个电机的差速,后轮横向移动配合完成2

为什么一上来讲这个: 因为它解释了链条的最后一环 —— 你后面辛辛苦苦训练出来的那个数,最终就是拿去改这两个前轮的转速的,不是别的。

赛场是故意不理想的

书里有一段很实在的话:理想的比赛环境应该是冷光源、低照度、没有磁场干扰; 但真实赛场上,地面可能有纹路、有不平整,边框上有裂缝,光照条件还会变 ——而书明说,「这恰恰是比赛的考核项之一」3

这一句要记住,它后面被反复兑现:

后面哪一章为什么是因为这一句
第 12 章靠颜色挑车道线的那条路,换个光照就得重调参数 —— 这是它最大的代价
第 13 章数据采集要分多个时间段做,就是为了让模型见过不同的光
第 13 章图片增强只做「改颜色」那一类,而且要随机地做

3. 车上唯一的输入,和唯一的输出

这一节是全书的枢纽。读完这一节,你就知道后面所有章节在算什么。

输入端:只有一只摄像头

创意赛用的是纯摄像头方案 —— 没有激光雷达,没有预先存好的路线。 书自己把这件事和产业界挂上了钩:特斯拉和 Mobileye 用的也是纯视觉方案, 这场比赛「可以将其理解为对现实世界纯视觉感知方案的模拟」4

摄像头拍出来的是一张 640×480 的彩色图 —— 按今天的标准这非常小, 640×480 只有约 30 万个像素点,而今天常见手机主摄随手一张是 1200 万,四十倍(手机像素是常识,不在书里)。 小是故意的:后面第 13 章还要把它压到 128×128 才敢送进模型。

输出端:一个 −1 到 1 之间的小数

这就是这本书全部的输出。 书在第 2 章就把它交代清楚了: 通过模型得到的转角预测值在 [−1, 1] 之间,大于 0 表示右转弯,小于 0 表示左转弯; 右转就右轮减速、左轮速度不变,左转反过来5

回到主走查:第 ① 步和第 ② 步

① 车停在起点,摄像头拍下第一帧
结果:一张 640×480 的彩色图。图里下半部分是车前的路面,
左右各一条车道线,此刻车头略微偏左

② 这一帧被送进(某个东西),算出一个数
结果:−0.4
↑ 这个 −0.4 是为演示编的,不是书里的数

③ −0.4 是负数 ⇒ 左转 ⇒ 左前轮减速、右前轮不变
结果:左轮 60、右轮 60 → 左轮 36、右轮 60
↑ 这两个转速也是为演示编的

第 ② 步那个括号,就是这本书的全部内容。 第 12、13、14 三章会给出三种不同的填法。 第 ③ 步最简单,第 02 章就当场写给你看。

这一对数据是全书的主走查输入:一张车前道路图,配一个 [−1, 1] 的转角。 它第一次出现在原书第 2 章,最后一次出现在第 10 章那个模型的最后一层。

4. 这条链最后跑在什么硬件上 —— 而这件事会反过来改造模型

这一节讲全书最容易被忽略、后果却最大的一个约束。

现象先行:两台机器,不是一台

训练和使用是两件事,发生在两个完全不同的地方:

阶段在哪儿跑条件
训练(把那些数试出来)云端平台,组委会指定,提供免费的高速计算卡6想跑多久跑多久
使用(车真的在跑的时候)拧在车上的一块小板子电池供电,算力就那么多

那块小板子在书里叫边缘计算板卡。这个词拆开看就明白: 「边缘」指的是离数据产生的地方最近的那一端(相对于「云端」那种放在机房里的大机器); 「计算板卡」就是一块能做运算的电路板。合起来:一块装在设备本体上、就地做运算的小电脑。 这场比赛硬性规定必须用组委会指定的那一块7

为什么非要装在车上

想想不装会怎样:车拍一张图,把图传到云上,云算完把转角传回来。 这一来一回的时间里,车已经开出去了。 而且赛场上一断网,车就瞎了。

所以推理必须就地做。代价是:这块板子的算力,反过来变成了模型设计的硬约束。

这个约束具体咬在哪儿

书自己在第 10 章说得很直白:巡航模型要部署在车上这块板子上跑, 「这种边缘计算开发板算力有限,因此要求网络模型规模较小」8

于是有了两处后果 —— 都不是审美选择,是被硬件逼的:

  1. 输入图被压到 128×128 —— 1.6 万个像素点,只有摄像头原图那 30 万个的十九分之一;
  2. 网络是自己设计的一个小网络,参数量(参数量 = 网络里那些靠训练一遍遍调出来的数一共有多少个) 只有它借鉴的那个经典模型的约四分之一

这条线索贯穿全书,第 13 章第一次真正兑现,第 16 章收尾。 到那时你会看到一件更反直觉的事:为了塞进这块板子,模型还得先被「压」一遍 —— 而压的过程要用到 50 张真实图片。

5. 这场比赛其实有两个任务,不是一个

读到这里你可能以为全书只干「让车沿线跑」这一件事。不是。

任务要回答什么输出长什么样在哪几章
自动巡航现在该往哪打方向一个连续的小数,−1 到 112、13、14
目标检测路边有什么、在哪儿一串框,每个框配一个类别名15、16

这两件事的输出形状完全不同,所以它们的做法、评价方式、训练数据全都不一样。

线上赛还有第三种输出形状

2023 年那一届的线上赛题目是:识别虚车道线、实车道线和斑马线的位置和类别。 书自己判定这是一个图像分割任务 —— 「分割」的意思是: 不给出框,而是给图上每一个小方格单独判一个类别9

主办方给的训练数据是 16000 张车载图片。它们的标注长得很特别: 每张标注是一张和原图一样大的灰度图 —— 背景处写 0,实车道线处写 1, 虚车道线处写 2,斑马线处写 310

原图的某一小块 对应的标注
┌───────────┐ ┌───────────┐
│ 路面 路面 │ │ 0 0 │
│ 路面 白线 │ ──▶ │ 0 1 │ ← 这个格子落在实车道线上
│ 白线 白线 │ │ 1 1 │
└───────────┘ └───────────┘

图说:标注不是「这张图里有车道线」,而是「这一格是,那一格不是」。
16000 张图,每张图几十万个格子,全部标好——这就是第三条路线的成本。

16000 这个数要有个参照物: 第 8 章那个入门项目用的数据集, 从公开数据里筛出来的样本只有 300 个;差了五十多倍。

6. 「人工智能」「机器学习」「深度学习」到底什么关系

这一节只讲一件事,但它是全书天花板级的一件事:读岔了,后面十五章的定位全塌。

先看现象

同一条新闻里,这三个词经常被换着用:「人工智能又下赢了一盘棋」 「这家公司用机器学习优化了配送」「深度学习让机器看懂了照片」。 读起来像是同义词,其实它们是一层套一层的。

四个圈,从外往里

书用一句话把它钉死了:深度学习 ∈ 神经网络 ∈ 机器学习 ∈ 人工智能11。 拆开就是:

┌─────────────────── 人工智能 ────────────────────┐
│ 凡是「让机器干本来只有人能干的事」都算 │
│ 会听、会看、会说、会思考、会学、会动 │
│ │
│ ┌──────────── 机器学习 ─────────────────┐ │
│ │ 实现人工智能的一条路:不写死规则, │ │
│ │ 让机器自己从大量例子里试出规则 │ │
│ │ │ │
│ │ ┌──────── 神经网络 ──────────┐ │ │
│ │ │ 机器学习里的一类具体做法: │ │ │
│ │ │ 用大量简单单元连成一张网 │ │ │
│ │ │ │ │ │
│ │ │ ┌──── 深度学习 ──────┐ │ │ │
│ │ │ │ 就是层数很多的 │ │ │ │
│ │ │ │ 神经网络。本书全在 │ │ │ │
│ │ │ │ 这一圈里 │ │ │ │
│ │ │ └────────────────────┘ │ │ │
│ │ └──────────────────────────────┘ │ │
│ └─────────────────────────────────────────┘ │
└─────────────────────────────────────────────────┘

图说:每往里一层,范围就更窄、做法就更具体。
「深度学习」不是「更高级的人工智能」,它只是最里面那一小圈的名字。

三对容易搞混的说法,一次讲清

听起来像其实是
「深度学习是人工智能的升级版」它是人工智能里面的一小块,不是新一代
「深度」= 很深奥「深度」指层数多。书还给了第二层意思:它能学到样本更深层次的特征(特征 = 从数据里提炼出来、能拿来做判断的那些线索)
「神经网络」= 模拟大脑它借了生物神经元的结构灵感,只是灵感;第 05 章会看到那个「神经元」实际上只做加法和乘法

这一句要带走:这本书从头到尾只在最里面那一圈里。 它自己也这么说 ——「本书主要介绍目前主流的深度学习方法,深度学习是深层的神经网络方法, 属于机器学习方法中的一种」12

7. 这一圈是怎么走到今天的,以及为什么书只讲这一支

上一节回答了「深度学习在哪儿」,这一节回答「为什么是它」。

三段浪潮,两次冬天

书把人工智能的六十多年分成三段,每一段靠什么驱动就叫什么名字13:

时期大致年代靠什么代表怎么结束的
计算驱动1956—1970 年代初靠搜索、靠穷举会对话的小程序、会下跳棋的程序做出来的东西「看起来都只是玩具」,当时的机器根本算不动
知识驱动1970 年代初—1990 年代中靠人把专家的知识一条条写进去医疗、化学、地质领域的专家系统知识太难录、领域太窄、和数据库对不上
数据驱动1990 年代中至今靠海量数据和算力下赢国际象棋、下赢围棋、今天的对话模型还在里面

「人工智能」这个词本身诞生于 1956 年夏天的一次会议 —— 十个人开了两个月,第一次用了这个说法14

两次冬天都值得记住,因为它们的死因不同: 第一次死于算不动,第二次死于知识录不进去。 第三段之所以能持续,是因为它两样都不靠 —— 它靠数据。

三大流派:书站在哪一边

书列了三派,并且明说了自己站哪边15:

流派它认为智能来自代表成果
符号主义符号和推理。人是一个符号系统,计算机也是,所以能模拟专家系统、推理机
连接主义神经元之间的连接。 既然生物智能由神经网络产生,那就人工造一张网出来训练它感知器、反向传播网络、卷积神经网络
行为主义感知与行动的直接耦合,靠对环境的适应,不靠表示和推理六足行走机器人

这本书整本站在连接主义这一支上。 后面十五章里出现的每一个模型, 都是上面那一行「代表成果」的直系后代。

8. 但这场比赛只做整条链的一段

这一节划边界。不划清楚,你会以为书漏讲了很多东西 —— 其实是它根本不管那一段。

书在前言里给了一整条链:汽车智能驾驶的核心技术是感知、决策和控制16。 第 1 章还列了八项支撑技术17:

偏「看见与判断」的偏「工程与配套」的
传感器 · 自动驾驶通信 · 人机交互
机器学习 · 高精度地图与定位数据安全 · 软件与系统集成

书对这八项每项只给两三句,是罗列不是讲解。 我们只取它给出的那个框。

感知 决策 控制
┌────────┐ ┌────────┐ ┌────────┐
│看见什么│───────▶│怎么走 │───────▶│怎么让 │
│ │ │ │ │轮子转 │
└────────┘ └────────┘ └────────┘
↑ ↑ ↑
这本书全在这儿 只碰了一点点 基本没碰

图说:这就是为什么后面十五章里从来没有出现过「控制器」这个东西。
不是书漏了,是书的范围到感知为止。

这一条要记住: 到第 14 章你会看到,书讲完「逐格判出车道线」之后, 只用一句「辅以相关算法即可完成自动巡航」就收尾了 —— 中间那两步(从图上抠出中心线、 从偏差算出该打多大角度)一个字没讲。按这张图,那不是遗漏,那是它的边界。

9. 全书施工图:后面十五章各在填哪一格

这是本章的落点。看完这张表,你就知道每一章为什么存在。

在填哪一格哪几章一句话
铺路:能指挥计算机02选 Python 的真实理由,以及怎么把一个转角变成两个轮速
铺路:数据进得来03、04图和标签怎么进程序;一张图对计算机到底是什么
原理:谁来算05最小的计算单元:一个人工神经元
原理:那些数怎么来06定尺子、下坡走 —— 机器学习的全部动作
原理:怎么叠起来07、08多层网络怎么算、怎么知道每个数该往哪挪
原理:变成一个工程09五步固定动作
原理:图像专用10、11为什么普通网络处理图像会炸,以及治法
正面作答(一)12不训模型,靠颜色挑
正面作答(二)13训一个网络直接吐转角
正面作答(三)14逐格判类别,以及三条路怎么选
第二个任务15、16认出路上的东西,并塞进那块小板子

10. 作者的判断与证据

这一节把「书里有证据的」和「书自己在下判断的」分开。

说法是哪一类
场地 600×480cm、车道约 50cm、四电机差速转向有证据: 赛事规则与实物,书直接给出
16000 张标注数据、标注是同尺寸单通道灰度图、类别编号 0/1/2/3有证据: 主办方给的数据集事实
「真实赛场的不确定因素恰恰是考核项之一」作者的判断。 这是编者对比赛意图的解读,规则本身没这么写。但它和第 13 章那条采集经验对得上
「创意赛可以理解为对现实世界纯视觉方案的模拟」作者的类比。 特斯拉那套系统和这场比赛在规模上差着十万八千里,这句话说的是思路相似,不是能力相当
三次浪潮、三大流派的划分教科书式的共识划分,书没有给出出处,也不是作者原创。当成地图看,别当成精确的历史

一处书内不一致,照实指出

第 1 章开头说「人工智能发展包含四个要求,即知识、数据、算法和算力」18; 同一章后面又说人工智能在「算法设计、算力提升以及数据资源(算料)这三大核心要素」上取得突破19

同一章里,四要素和三要素两种说法并存。 这类清单本来就没有权威版本, 差别不影响任何技术结论 —— 但它是这本书缺一轮统稿的第一个信号,后面还有更硬的(见第 15 章)。

我们的一条判断

判断(我们的,不是书里的): 这一章里最值钱的不是场地尺寸, 是**「训练在云上、使用在车上」这条分工**。它是全书唯一一条从第 1 章咬到第 16 章的约束: 第 13 章那个网络为什么这么小、第 16 章那个部署流程为什么要多做六件事, 答案都只有一个 —— 车上那块板子。 大多数深度学习教材没有这条约束,所以它们的模型可以随便大; 这本书从第一页起就没有这个自由。 如果错,会错在: 如果哪天车上那块板子的算力大到不再是瓶颈, 这条贯穿线就会退化成一段历史,后面十五章里由它推出来的设计选择也就不再必要。 判据是:同样的任务换一块算力充裕的板子,那些「压小、压小、再压小」的动作还做不做。

11. 边界与局限

  • 这一章的内容有一半来自原书第 10 章,不是第 1 章。 原书把「赛场什么样」拆在头尾两处, 中间隔了八章;读者不先看到车和场地,后面根本读不懂。我们把它合并前置了。
  • 原书第 1 章约三分之一的篇幅是中国人工智能发展史与政策文件罗列。 那是教材的规定动作,与技术链条无关,我们整体不采用。
  • 书没有解释那块板子里面是什么。 全书把它当作已知,而它的内部结构恰恰解释了 第 16 章那个看起来莫名其妙的部署流程 —— 我们在第 16 章补了外部资料。
  • 书没有交代车速怎么控制。 只有第 12 章提到两个速度参数可以调,再无下文。
  • 「智能汽车八项关键技术」那一节是罗列,不是讲解。 每项两三句话,没有展开。 我们只取它给出的那个框(感知 → 决策 → 控制),因为那个框有用。

12. 可带走的

全章那条走查,一行写完:

车停在起点 → 摄像头拍下一张 640×480 的图 → (全书十六章要填的那个空)→ 得到 −0.4 → 负数,左转 → 左前轮 60 降到 36、右前轮仍是 60 → 车往左偏一点 → 拍下一帧,从头再来。

其中 −0.4 和两个转速是为演示编的,不是书里的数。

  1. 这场比赛非常具体: 28.8 平方米的一块布、一辆四电机小车、一只朝前的摄像头;
  2. 车上唯一的输入是一张 640×480 的图,唯一的输出是一个 −1 到 1 的小数 —— 全书就是围着这一对数据转的;
  3. 转向靠前轮差速,不是方向盘 —— 所以「转角」最后落到的是两个轮子的转速差;
  4. 赛场的不确定性是考核项,不是干扰 —— 这句话是后面所有「换个光照就不行」的伏笔;
  5. 训练在云上,使用在车上那块小板子上;板子的算力反过来决定了模型能多大 —— 这是全书最贯穿的一条约束;
  6. 比赛有两个任务: 巡航(吐一个连续的数)和检测(框出位置 + 说出类别),做法完全不同;
  7. 四个圈,从外到内: 人工智能 ⊃ 机器学习 ⊃ 神经网络 ⊃ 深度学习。 「深度」指的是层数多,不是深奥;
  8. 人工智能走过三段: 靠穷举、靠人录知识、靠数据。前两段各死于一次冬天,死因不同;
  9. 三大流派里,这本书整本站在连接主义那一支上;
  10. 完整的链是感知 → 决策 → 控制,而这本书只做感知那一段 —— 记住这条边界,你就不会以为书「漏讲」了控制。

13. 原文地图

主题原书章原文位置
赛场尺寸、车道宽度、起点、理想环境与真实环境第10章 智能车自动巡航算法设计及部署text/11-ch10.txt:23(搜「600cm×480cm」) · text/11-ch10.txt:23(搜「这恰恰是比赛的考核项之一」)
车模结构:四电机、后轮横摆、前轮差速第10章 智能车自动巡航算法设计及部署text/11-ch10.txt:25(搜「四个电机」)
线上赛题目与「典型的图像分割任务」判定第10章 智能车自动巡航算法设计及部署text/11-ch10.txt:17(搜「图像分割任务」)
16000 张数据集与灰度标注编号第10章 智能车自动巡航算法设计及部署text/11-ch10.txt:19(搜「16000张」)
训练平台与免费算力第10章 智能车自动巡航算法设计及部署text/11-ch10.txt:15(搜「免费GPU算力」)
板卡是硬性规定第10章 智能车自动巡航算法设计及部署text/11-ch10.txt:23(搜「必须使用组委会指定」)
纯视觉方案与特斯拉的类比;绿色分隔车道线第10章 智能车自动巡航算法设计及部署text/11-ch10.txt:37(搜「纯视觉自动驾驶方案」) · text/11-ch10.txt:39(搜「使用绿色将车道线」)
板卡算力有限,所以模型要小第10章 智能车自动巡航算法设计及部署text/11-ch10.txt:189(搜「算力有限」)
转角 [−1,1] 与差速转向规则第2章 Python基本语法元素及数据类型text/03-ch02-2-python.txt:39(搜「右轮减速」)
四个圈的包含关系第8章 深度学习基础及车辆识别项目实践text/09-ch08.txt:17(搜「深度学习∈神经网络」)
「深度」的两个含义、浅层网络层数第8章 深度学习基础及车辆识别项目实践text/09-ch08.txt:59(搜「网络层数深」)
三次浪潮、达特茅斯会议、两次低谷第1章 绪论text/02-ch01.txt:23(搜「三次浪潮」) · text/02-ch01.txt:31(搜「达特茅斯」) · text/02-ch01.txt:39(搜「玩具」) · text/02-ch01.txt:45(搜「又一次陷入低谷」)
三大流派与本书的立场第1章 绪论text/02-ch01.txt:127(搜「三大流派」) · text/02-ch01.txt:133(搜「连接主义」) · text/02-ch01.txt:141(搜「本书主要介绍」)
智能汽车八项关键技术第1章 绪论text/02-ch01.txt:149(搜「环境感知」) · text/02-ch01.txt:153(搜「传感器技术」)
感知、决策、控制这条链Preface 前言text/01-fm-preface.txt:9(搜「感知、决策和控制」)
四要素 / 三要素的不一致第1章 绪论text/02-ch01.txt:11(搜「四个要求」) · text/02-ch01.txt:55(搜「三大核心要素」)
2023 年赛题主题与两项任务第1章 绪论text/02-ch01.txt:185(搜「长江之歌」)

Footnotes

  1. 出处:「第10章 智能车自动巡航算法设计及部署」第 23 段(text/11-ch10.txt:23,搜「600cm×480cm」)。同一段给出材质(PU 布或喷绘布)、车道含黄线约 50cm、起点在地图左下角。补充(不在书里,来自通用知识):标准教室地面通常在 60 平方米上下,用于给 28.8 平方米一个参照;办公椅宽度约 50—60 厘米,用于给车道宽度一个参照。

  2. 出处:「第10章 智能车自动巡航算法设计及部署」第 25 段(text/11-ch10.txt:25,搜「四个电机」)。原文:底盘包含四个电机分别驱动四个车轮,后轮使用近似麦克纳姆轮因此可以横向摆动,转向时由前轮双电机进行差速控制。「麦克纳姆轮」是一种轮缘上斜装着一圈小滚子、因而能横向移动的轮子,书没有解释这个名字,这里补一句(通用知识)。

  3. 出处:「第10章 智能车自动巡航算法设计及部署」第 23 段(text/11-ch10.txt:23,搜「这恰恰是比赛的考核项之一」)。原文把「塑造智能车的环境适应力」称为重要的工程要点。

  4. 出处:「第10章 智能车自动巡航算法设计及部署」第 37 段(text/11-ch10.txt:37,搜「纯视觉自动驾驶方案」)。原文提到特斯拉和 mobileye 的纯视觉方案,并说这场比赛「可以将其理解为对现实世界纯视觉感知方案的模拟」。

  5. 出处:「第2章 Python基本语法元素及数据类型」第 39 段(text/03-ch02-2-python.txt:39,搜「右轮减速」)。原文明确:转角预测值在 [-1,1] 之间,大于 0 表示右转弯,小于 0 表示左转弯;右转时右轮减速、左轮速度不变。补充(不在书里,来自通用知识):640×480 = 307 200 个像素点,而今天手机主摄常见 1200 万像素,约为四十倍。

  6. 出处:「第10章 智能车自动巡航算法设计及部署」第 15 段(text/11-ch10.txt:15,搜「免费GPU算力」)。原文说明线上选拔赛的指定训练平台提供在线编程环境与免费 GPU 算力。

  7. 出处:「第10章 智能车自动巡航算法设计及部署」第 23 段(text/11-ch10.txt:23,搜「必须使用组委会指定」)。原文:参赛队伍必须使用组委会指定的百度 EdgeBoard 边缘计算板卡进行比赛。这块板子内部是什么、为什么部署时要多做几道工序,书全程没有解释,我们在第 16 章补了外部资料。

  8. 出处:「第10章 智能车自动巡航算法设计及部署」第 189 段(text/11-ch10.txt:189,搜「算力有限」)。原文同段还给出输入尺寸 128×128「远小于 AlexNet 输入图像尺寸,参数量仅约为其 1/4」。

  9. 出处:「第10章 智能车自动巡航算法设计及部署」第 17 段(text/11-ch10.txt:17,搜「图像分割任务」)。原文:赛题要求识别虚车道线、实车道线和斑马线的具体位置和类别,不限制任务类型,「从任务要求来看,这是一个典型的图像分割任务」。

  10. 出处:「第10章 智能车自动巡航算法设计及部署」第 19 段(text/11-ch10.txt:19,搜「16000张」)。原文:标注数据是与原图尺寸相同的单通道灰度图,背景像素灰度值为 0,实车道线、虚车道线、斑马线的类别编号分别为 1、2、3。作为对照的 300 个样本见「第6章 文件和数据格式化」第 223 段(text/07-ch06.txt:223,搜「300个样本」)。

  11. 出处:「第8章 深度学习基础及车辆识别项目实践」第 17 段(text/09-ch08.txt:17,搜「深度学习∈神经网络」)。原文一句话给出四者关系,并说明机器学习是实现人工智能的一种基本途径、神经网络是隶属于机器学习的一个具体算法方向。人工智能「会听会看会说会思考会学会行动」的描述见同书「第1章 绪论」第 107 段(text/02-ch01.txt:107,搜「会听」)。

  12. 出处:「第1章 绪论」第 141 段(text/02-ch01.txt:141,搜「本书主要介绍」)。「深度」的两个含义见「第8章 深度学习基础及车辆识别项目实践」第 59 段(text/09-ch08.txt:59,搜「网络层数深」)。

  13. 出处:「第1章 绪论」第 23 段(text/02-ch01.txt:23,搜「三次浪潮」),三段的具体内容见第 27—55 段。第一次低谷的原因见第 39 段(text/02-ch01.txt:39,搜「玩具」),第二次见第 45 段(text/02-ch01.txt:45,搜「又一次陷入低谷」)。

  14. 出处:「第1章 绪论」第 31 段(text/02-ch01.txt:31,搜「达特茅斯」)。原文:1956 年夏季,由四位学者共同发起并邀请另外六位年轻科学家,举办了一次长达两个月的十人研讨会,首次使用了「人工智能」这一术语。

  15. 出处:「第1章 绪论」第 127 段(text/02-ch01.txt:127,搜「三大流派」),连接主义的定义见第 133 段(text/02-ch01.txt:133,搜「连接主义」),代表成果见第 135 段(text/02-ch01.txt:135,搜「感知器是一种最简单」)。

  16. 出处:「Preface 前言」第 9 段(text/01-fm-preface.txt:9,搜「感知、决策和控制」)。原文把这三个词称为汽车智能驾驶的核心技术。

  17. 出处:「第1章 绪论」第 149 段(text/02-ch01.txt:149,搜「环境感知」)与第 153—167 段(text/02-ch01.txt:153,搜「传感器技术」)。原文把智能汽车定义为集环境感知、规划决策、多等级辅助驾驶于一体的综合系统,并逐条列出八项关键技术。

  18. 出处:「第1章 绪论」第 11 段(text/02-ch01.txt:11,搜「四个要求」)。

  19. 出处:「第1章 绪论」第 55 段(text/02-ch01.txt:55,搜「三大核心要素」)。原文用的是「算法设计、算力提升(计算能力)以及数据资源(算料)这三大核心要素」。