跳到主要内容

大纲 — 图解机器学习算法(12 章)

切分原则:按推理链与新词密度切,不按字数。原书 17 个算法每个自带「概述/算法说明/示例代码/详细说明」 四段式,我们改成「问题→机制→走查→边界」;评估(4.1)单独成章,因为它被原书从第 1 章起反复欠账。 原书第 5 章(环境搭建)是安装指南,并入第 01 章工具链一节,不单独成章。

#文件原书章进来时以为 → 出去时知道
0101-overview.md1.1 + 1.2 + 第5章机器学习就是「AI 那套东西」→ 它只是三类任务(有答案/没答案/给奖励),全部输入都是一张二维表格,一次完整实验=载入数据→fit→predict→打分,而打分那一步从第一天起就有两个坑(过拟合、不均衡数据)
0202-linear-regression-regularization.md2.1 + 2.2学模型就是找条拟合线 → 有监督学习的共同内核是「定一个损失函数,找让损失最小的参数」;但「训练误差最小」不等于模型好,给损失加一个惩罚项(正则化)压住参数,模型才能对没见过的数据也好
0303-logistic-regression.md2.3名字带回归的算法做回归 → 它其实算概率:线性回归的输出过一个 S 形函数压进 0~1,过 0.5 阈值就是分类;系数的符号还能告诉你每个特征在往哪边推
0404-svm-kernel.md2.4 + 2.5分类边界画出来就行 → 边界有好坏:离两边数据最远的「最宽边界」最稳(支持向量说了算);遇到圆形分布的曲线边界,把数据抬进更高维再画直线,核函数让你不用真付高维的代价
0505-naive-bayes.md2.6文本分类很高深 → 它就是数单词:把句子拆成词袋,按「每个词在各类别出现的条件概率」连乘比大小;「朴素」指假装词与词相互独立,这个假设便宜但出了名地不准
0606-random-forest.md2.7一棵树就够了 → 单棵树靠「选让基尼系数降最多的切口」反复切数据;一群各吃各的数据、各看各的特征的树投票,比一棵树稳(0.6×3 投票=0.648),还白送一份特征重要度
0707-neural-net-knn.md2.8 + 2.9神经网络高不可攀,KNN 太土 → 神经网络的全部秘密是「在输入输出之间夹一层」,两条直线夹出一块区域就能分线性不可分数据;KNN 把「学」推到极致——干脆不学,预测时现找 k 个近邻投票,代价是大查询慢、高维失灵
0808-dim-reduction-matrix.md3.1 + 3.2 + 3.3降维=删列 → 三种压缩法各砍一刀:PCA 找方差最大的新轴(特征值问题);LSA 用矩阵分解把「车/汽车」拉近;NMF 强制非负,分解出来的每个因子都是可解释的部件(人脸的部分特征)
0909-dim-reduction-topics-manifold.md3.4 + 3.7 + 3.8文本主题和「弯曲的数据」也得靠 PCA → LDA 把文本写成主题的配方;LLE/t-SNE 承认数据是卷起来的(瑞士卷),只保局部关系把它摊平;t-SNE 用重尾的 t 分布硬把团块分开,但只肯降到 2~3 维
1010-clustering.md3.5 + 3.6聚类就是把近的归一堆 → k-means 用「重心─分配」来回拉锯直到不动点,好坏用簇内平方和量,簇数看肘部;混合高斯更进一步:不说「属于谁」,说「以 0.7 的权重属于谁」,椭圆簇也能吃
1111-evaluation.md4.1正确率高=模型好 → 正确率会骗人(95 阳/5 阴全猜阳=95%);混淆矩阵拆出精确率/召回率这对跷跷板,调阈值能在两者之间换;不均衡数据看 AUC;回归看 R² 不看 MSE 绝对值;防过拟合靠留出、交叉验证,调参靠网格搜索
1212-text-image-features.md4.2 + 4.3什么数据都能直接喂 → 模型只吃数字表格:文本靠计数或 tf-idf(常见词压分、独家词抬分,实测 0.794→0.870)变表格;图像把像素拉平成向量,代价是扔掉二维邻近关系——那是深度学习的入场券

自查(两两对「出去时知道」)

  • 02(损失最小化+正则化)与 11(评估/过拟合的对策):02 管训练时的机制(惩罚项怎么改参数),11 管「怎么发现和度量」过拟合(留出/交叉验证)——不重复,互为前后。
  • 08 与 09:08 三种矩阵压缩(线性代数系),09 主题模型+流形(概率/几何系),原书 3.2 里自己说「NMF 和 LDA 更容易解释」,顺着这条缝切开。
  • 03 与 05:03 判别式(直接算 P(y|x)),05 生成式思路(数词频连乘)——第 05 章开头点破这个差别。
  • 每章一条主走查已定位:01 乳腺癌全流程;02 两个四点数据均方误差 2.89/5.83 + sin 数据 d=6 过拟合表;03 气温 0/1/2℃→0.12/0.50/0.88;04 软间隔三点+高维抬升;05 词袋连乘 0.137 vs 0.0000154;06 基尼 0.5/0.44/0.25 + 三树投票 0.648;07 感知机数值代+两条线夹区域;08 A·x 特征向量 (4,4);09 LDA 五句英文;10 k-means 四步两轮;11 混淆矩阵 341/16/36/176→阈值 0.1;12 tf-idf 0.41/0.70。