跳到主要内容

这本书在桥接什么 — 一场暑期学校和一只入耳翻译机

这一章讲三件事: 这是一本什么性质的书;「嵌入 AI」这个词到底指什么; 以及全书的五个原文章怎么拼成一条完整的产业链。 读完你会拿到全书的地图——后面八章都是在这张地图上放大某一段。 不需要任何硬件基础,遇到的生词都当场解释。

1. 先说清这是一本什么书

你拿到这本书之前,大概率以为它是又一本「嵌入式 AI 入门」。不是。

它的真身是一份暑期学校的讲义集。2025 年前后,IEEE 的电路与系统学会 (CAS,一个全球性的电路工程师学术组织)办了一所「人工智能技术季节学校」, 这本书就是把那几天课堂上的五场报告整理成章1

IEEE 是「电气电子工程师学会」的缩写,全球最大的电子工程学术组织; 「暑期学校」在这里不是给中小学生补课,而是给研究生和工程师开的几天密集短训。

办这所学校的理由,原书写得很直白:嵌入式技术和深度学习应用之间, 横着一道巨大的技能鸿沟1。会设计晶体管的人大多没训过神经网络, 会训神经网络的人大多不知道一个晶体管是怎么造出来、怎么测出来的。 任何一方单干,都做不出「能跑 AI 的芯片」。所以学校干脆把两边的人拉进同一间教室, 从造器件一路讲到跑应用。

这解释了这本书读起来为什么和别的书不一样:每一章是一场报告,讲者不同、口音不同、 深浅不同。有人讲得很细(语音识别、晶体管测量两章几乎每页都有讲稿), 有人只留下一页页提纲(6G 那一章的正文只有提纲和图)。 我们这份拆解做的事,就是把五场口音各异的报告,重写成一条连贯的链。

2. 「嵌入 AI」到底指什么

这一节只讲一个词,但它是全书的书名,值得把边界画清楚

嵌入 AI(Embedded AI)指:把机器学习(让机器从数据里自己学规律的技术总称)模型放进边缘设备里去运行。

——这类设备的资源(算力、内存、电池)样样受限。 三个词各管一个约束:

约束日常的样子
嵌入设备是封闭小盒:不能插网线、不能拖电源线耳机、手表、摄像头、汽车部件
边缘(edge)数据在现场就地处理,不送远处的机房你对着耳机说话,翻译在耳机里完成
资源受限算力、内存、电池全都只有云端设备的百分之一量级一颗纽扣电池要撑几天到几个月

原书把动机讲成一笔交易:现在的 AI 和深度学习应用要吃掉大量算力, 而把数据都送去云端又牺牲了安全与隐私;嵌入 AI 的解法是让模型在边缘设备上就地运行—— 代价是必须同时做两件事:把模型优化(在体积、速度、耗电上改到更好)到足够小,把硬件做得足够轻、足够省电2

判断(我们的,不是书里的): 这三个约束里,电池是最硬的那个。 算力不够可以等(识别慢半秒也能用),内存不够可以换算法, 但功耗超了设备直接没法卖——这也是为什么全书后半部分(射频、Green AI) 反复出现的衡量标准是「省了多少电」而不是「快了多少」。 如果错,会错在: 如果某类设备其实插着电(摄像头、基站), 那么对它们来说时延(一句话发出去到收到回音要等多久)和带宽才是首要约束,功耗排序要往后放。

3. 全书地图:从沙子到语义的一条链

这一节是全书的目录的目录。 原书五章看起来各讲各的——6G、语音识别、 晶体管测量、射频电路、绿色 AI——但把它们按「一只设备从无到有」的顺序排开, 正好是一条完整的链:

「我要一只会说两种语言的耳机」


① 应用与连接:设备怎么连网、要什么频段、电从哪来 ← 原书第1章(本书第02章)


② 大脑:语音识别模型怎么把声音变文字,再压到装得下 ← 原书第2章(本书第03、04章)


③ 器件:跑这个模型的晶体管长什么样、怎么造 ← 原书第3章前半(本书第05章)


④ 测量:造出来之后怎么测准它的参数,喂给设计工具 ← 原书第3章后半(本书第06章)


⑤ 电路:声音和无线电信号怎么进出,怎么省着电处理 ← 原书第4章(本书第02、07、08章)


⑥ 能量:整台设备的电费账单,和更省的计算范式 ← 原书第5章(本书第09章)

图说:这不是原书的章节顺序,是我们按「制造一只设备会经过哪些部门」重排的。
每一只箭头都是一次交接:上一环的输出,是下一环的输入约束。

这张图是全书的主走查对象。 下面拿原书里真实存在的那个设备当样本走一遍。

4. 主走查:拆一只入耳翻译机

原书五个正文章里有三个都在为同一个欧洲项目干活:FVLLMONTI。 它的目标原书写得具体:做一只轻量、省电的入耳设备,能做语音到语音的翻译3。 别小看这只耳机——把它拆开,每一层都对应原书一章:

外壳:塞进耳朵,所以必须小、必须省电
│ 这一条约束往里传:

软件层:语音识别模型要把错误率压到可用,再把体积压到能装
│ 书里的实测数字:模型从 99MB 压到 20MB,错误率只从 6.6% 升到 7.2%
│ (第 04 章细讲这组数怎么来的)

器件层:跑模型的晶体管必须是新兴的「垂直纳米线」结构
│ 因为传统平面晶体管在这个尺寸下漏电、发热都压不住
│ (第 05 章讲它怎么工作,第 06 章讲怎么把它测准)

通信层:识别结果要变回声音/数据发出去,射频电路要在 sub-THz 频段省电工作
│ (第 07 章讲省电的信号处理,第 08 章讲更省的「先理解再传」)

能量层:上面每一层省下来的、漏出去的电,最后都算在同一块电池头上
(第 09 章算这本总账)

图说:sub-THz 指 300GHz 附近的无线电频段,比 5G 用的频段高一个数量级;
「99MB/20MB/6.6%/7.2%」是原书语音识别一章给出的实验数据,第 04 章会走到它们。

读完这本书你应该能回答: 这只耳机里每一个零件,为什么必须是书里讲的那个样子, 换一种做法会在哪一层卡住。这就是「读完拆解就不必看原书」的判据。

5. 三个项目怎么把链条连起来

原书里反复冒出三个项目名,读起来像背景噪音,其实是全书数字的出处4:

项目管链条哪一段书里的痕迹
FVLLMONTI器件 + 语音:垂直纳米线晶体管、铁电存储、入耳翻译第 2 章的识别与压缩实验、第 3 章的测量对象都是它
HERMES射频:用普通 CMOS 工艺做 sub-THz 认知无线电芯片第 4 章后半的收发机设计都挂在这面旗下
RadioSpin自旋电子:用电子自旋而非电荷来做神经网络计算编者是协调人;书中着墨最少,只在背景里出现

CMOS 是今天几乎所有芯片用的标准制造工艺;「认知无线电」指能自己感知环境、 自己调整收发参数(收发机自己可调的那些设定)的无线电;「自旋」是电子自带的小磁针属性,理论上翻动它比搬电荷省电。

为什么这个结构值得记住: 这本书的编者就是三个项目的参与者(两位编者分别 协调 FVLLMONTI 和 RadioSpin5)。所以它不是旁观者写的综述,而是施工队自己画的图纸—— 好处是每个数字都有实验出处,坏处是对自家路线的乐观要多留一分心。 这一点我们在第 09 章还会再碰到。

6. 可带走的

  1. 这是一份暑期学校讲义集,不是通识书;五章五场报告,深浅口音不一,我们的拆解负责把它们抹平;
  2. 嵌入 AI = 三约束同时成立:封闭小盒、就地处理、资源受限;最硬的约束是电池;
  3. 全书是一条链:应用连接 → 模型 → 器件 → 测量 → 电路 → 能量,每一环的输出是下一环的输入约束;
  4. 一只入耳翻译机是全书的主走查样本,后面的章会反复回到它身上取数;
  5. 三个欧洲项目(FVLLMONTI/HERMES/RadioSpin)是书里数字的出处,编者即施工队——数字可信,乐观打折。

7. 原文地图

主题原书章原文位置
暑期学校与技能鸿沟Introductiontext/05-fm-introduction.txt:6(搜「massive skill gap」)
嵌入 AI 的动机与两件事Introductiontext/05-fm-introduction.txt:13(搜「machine learning models on edge」)
课程链条Introductiontext/05-fm-introduction.txt:19(搜「comprehensive curriculum」)
FVLLMONTI 目标Introduction to Automatic Speech Recognitiontext/07-ch02-chapter-2-introduction-to-automatic-speech-recog.txt:404(搜「speech-to-speech translation」)
三个项目Introductiontext/05-fm-introduction.txt:8(搜「FVLLMONTI, HERMES, and RadioSpin」)
压缩实验数字Introduction to Automatic Speech Recognitiontext/07-ch02-chapter-2-introduction-to-automatic-speech-recog.txt:449(搜「5X size reduction」)

Footnotes

  1. 出处:「Introduction」第 5 段(text/05-fm-introduction.txt:5,搜「Seasonal School」)。原文:学校的宗旨是弥合嵌入式技术与深度学习应用之间「巨大的技能鸿沟」。学校由 IEEE CAS 主办、三个 H2020 欧洲项目支持。 2

  2. 出处:「Introduction」第 13 段(text/05-fm-introduction.txt:13,搜「machine learning models on edge」)。原文把交易讲成两句:现在的 AI 应用要大量算力、常以安全与隐私为代价;嵌入 AI 让模型在边缘设备上运行,为此需要软硬件结合的优化模型与轻量省电的神经网络硬件。

  3. 出处:「Introduction to Automatic Speech Recognition」第 404 段(text/07-ch02-chapter-2-introduction-to-automatic-speech-recog.txt:404,搜「in-ear device」)。原文:FVLLMONTI 要造「轻量、节能的入耳设备,实现语音到语音翻译」。

  4. 出处:「Introduction」第 8 段(text/05-fm-introduction.txt:8,搜「RadioSpin」)。三个项目名与「跨学科社区」的定位都在这一段。

  5. 出处:「About the Editors」第 33 段(text/11-fm-about-the-editors.txt:33,搜「FVLLMONTI」)与第 62 段(text/11-fm-about-the-editors.txt:62,搜「RadioSpin」)。Maneux 教授是 FVLLMONTI 的协调人,Saïghi 教授是 RadioSpin 的协调人。