Skip to content

学习路径:三条路线

本页速览 本站 50 余页内容不是要你通读的图书馆,而是可以按需组合的路线图:为三个月内要面试的人准备求职冲刺线,为想打牢底子的人准备八周系统精进线,为在职建造者准备「问题 → 页面」的案头速查索引。

学习路径:三条路线 ​

这个站点有 50 多页内容。如果你从第一页顺着读下去,大概率会在核心知识章的第四篇开始走神——不是内容不好,而是通读不是学习机器学习这门学科的正确姿势。你需要的不是图书馆,是路线图。

本站内容其实只有四种性质:建立概念的(导读)、解释机制的(核心知识)、提供证据的(案例与论文)、改变你行为的(实践与求职)。不同处境的人,应该以完全不同的顺序和深度消费它们。这一页给出三条已经排好的路线,你对号入座即可。

text
                    你的处境是什么?
                          │
          ┌───────────────┼───────────────────┐
          ▼               ▼                   ▼
   1-3 个月内面试    时间充裕,想转行      已经在做 ML
          │               │                   │
   ┌────────────┐  ┌───────────────┐   ┌─────────────┐
   │ ① 求职冲刺线 │  │ ② 系统精进线   │   │ ③ 案头速查线  │
   │   约 2 周   │  │   约 8 周     │   │  不通读,随用  │
   ├────────────┤  ├───────────────┤   ├─────────────┤
   │ career 主线 │  │ 导读→知识→案例 │   │ 遇到问题      │
   │ +高频概念   │  │ →实践→论文     │   │ →查索引表     │
   │ +动手 demo  │  │ 每周有检验标准 │   │ →回到工作     │
   ├────────────┤  ├───────────────┤   ├─────────────┤
   │产出:改好的  │  │产出:能讲清    │   │产出:当下的   │
   │简历+10 道题 │  │整套体系+作品集 │   │问题被解决     │
   └────────────┘  └───────────────┘   └─────────────┘

三条路线不是互斥的

很多人的真实轨迹是:先按速查线用了本站几个月,决定转型后走一遍系统线,临面试前再跑一遍冲刺线的后半段。路线是导航,不是铁轨。

路线一:求职冲刺线(约 2 周) ​

适用人群:1–3 个月内有机器学习/算法岗面试,已具备基础编程能力(Python),没有整块时间,只有晚上和周末。

核心思路:面试考察的本质是两件事——你能否把机器学习体系讲清楚(从概率到模型到工程),以及你的简历和表达能否通过筛选。所以这条线以终为始,从 JD 和面试题倒推学习内容,不求全面,只求高频考点全部覆盖、每个考点都能说出"为什么"。

主线:career 模块四篇 ​

顺序页面你要拿走的东西
1JD 清单:国内外大厂在招岗位目标岗位到底要求什么,把其中反复出现的技能词抄下来
2能力地图把 JD 里的技能词映射到本站页面,生成你个人的补课清单
3简历分析按里面的标准重写你的项目经历,突出模型与业务决策
4面试题解析最后用它自测,而非第一天就看

配菜:最高频被考的概念 + 一个动手 demo ​

从 JD 和面试题的分布看,以下四篇覆盖了绝大多数"算法侧"考点,按这个顺序读:

  1. 模型评估与验证——几乎每场 ML 面试必考,过拟合、偏差方差、AUC、交叉验证要能脱口而出;
  2. 监督学习——线性/逻辑回归、SVM、决策树的基本原理与推导;
  3. 过拟合与正则化——L1/L2、Dropout、早停的区别与使用场景;
  4. 优化与梯度下降——梯度消失/爆炸、学习率、SGD/Adam 的取舍。

如果只能再加一篇,加深度学习基础——大模型时代几乎所有岗位都会问。

光看不练的简历没有说服力。用周末跑通从零构建一个 ML 项目:仓库里的 v1 最小线性回归只有几十行,v2 加特征工程与评估、v3 换梯度提升树,逐层跑一遍、改一改,你就拥有了一个可以在面试时讲五分钟不带停的亲手项目。

两周节奏 ​

第一周(理解 + 简历):

  • 周一到周三:JD 清单 → 能力地图,产出你的补课清单;
  • 周四到周五:按上面顺序读四篇概念文,每篇读完合上书,用手机录音给自己讲一遍核心机制,讲不顺的地方回读;
  • 周末:跑通 build-your-own 的 v1→v3;按简历分析页的标准改完简历初稿。

第二周(表达 + 自测):

  • 周一到周三:面试题解析,每道题先自己答再对照,把答不上来的标红回炉对应概念页;
  • 周四到周五:找朋友或用语音自问自答做模拟,重点练"为什么"类问题(为什么 L1 产生稀疏解?为什么树模型不用归一化?);
  • 周末:定稿简历,把 demo 项目整理成能展示的仓库。

两周后的验收标准

你手里应该有三样东西:一份按算法岗标准重写过的简历、一个跑得通讲得清的 ML 项目仓库、10 道能讲出取舍和推导的面试题答案。少一样,说明对应环节偷工了。

路线二:系统精进线(约 8 周) ​

适用人群:时间相对充裕(每周能投入 8–10 小时),想在 1–2 个季度内完成转型或打牢底子,看重体系而不是速成。

核心思路:机器学习知识是有依赖图的——不理解评估就看不懂正则化,不理解特征工程就看不出案例的门道,没拆过案例就写不出自己的设计原则。这条线按依赖顺序排布,每周附检验标准,达不到就不要进下一周。

周内容检验标准
第 1 周导读五篇:什么是机器学习 → ML vs AI → 历史 → 解剖 → 学习路径能向一个没学过的人讲清"机器学习和传统编程的区别",并画出 ML 项目四环节(数据→模型→算法→评估)
第 2 周数学地基:数学基础速查 的线性代数与概率部分 + 监督学习能手推线性回归的最小二乘解;讲清最大似然估计的含义
第 3 周评估与正则化:模型评估与验证 → 过拟合与正则化 → 优化与梯度下降能解释偏差-方差权衡并说出至少三种应对过拟合的手段;说清梯度下降、SGD、Adam 的差别
第 4 周特征与数据:特征工程 → 数据与数据工程;案例选读树模型与集成学习、线性模型拿到任意一张表格数据,能列出完整的特征工程清单(缺失值、编码、缩放、交互)
第 5 周无监督:无监督学习 + 案例聚类与降维;动手:从零构建一个 ML 项目 的 v1→v3能说清 K-Means 与 PCA 的原理与局限;demo 跑通并能解释每步在做什么
第 6 周深度学习:深度学习基础 → 案例 CNN、Transformer能徒手画出多层感知机前向/反向传播,说清卷积与注意力的核心思想
第 7 周实践收尾:调参与超参数优化 → 设计原则 → 常见陷阱 → 评估实践你的项目能在别人的机器上跑起来,并且你能说出它在什么输入下会失败
第 8 周论文 + 求职材料收尾:经典论文精读 至少精读 3 篇(如 AlexNet、Attention、ResNet),前沿进展 选读;然后走 career 模块能讲清至少两篇经典论文的动机与贡献;简历和 10 道题答案达到路线一的验收标准

关于第 5 周的硬性要求

八周里唯一不可压缩的是动手周。读完概念文时你会产生一种"我已经懂了"的错觉——这种错觉会在你第一次面对真实脏数据时碎掉。没有亲手被 NaN、类别不平衡、过拟合教育过,转型是不算完成的。

时间实在紧张的话,第 6 周的深度学习和第 8 周的论文可以各砍一半,但导读、评估、动手这三段不要砍——它们是这条线的承重墙。

路线三:案头速查线(在职建造者) ​

适用人群:已经在做机器学习相关开发,问题是以"今天卡住了"为单位出现的,没有通读的需求和耐心。

这条线的用法是:遇到问题时从下表查入口页,读完解决问题就走,不要顺藤摸瓜。 摸瓜留给周末。

你遇到的问题去看
模型在训练集很好、测试集一塌糊涂过拟合与正则化、模型评估与验证
不知道用什么指标评估模型(分类/回归/排序)模型评估与验证
数据有大量缺失值和类别变量,不会处理特征工程、数据与数据工程
训练慢、不收敛、loss 震荡优化与梯度下降、调参与超参数优化
类别不平衡,正样本极少模型评估与验证(类别不平衡小节)
该用 XGBoost 还是神经网络树模型与集成学习、框架与工具怎么选
想快速跑通一个端到端项目从零构建一个 ML 项目、渐进式教程
模型上线后效果变差MLOps 与模型部署(监控与漂移检测)
老板/客户问"模型为什么这么判断"可解释性与公平性
深度学习模型该从哪下手深度学习基础、CNN、Transformer
想了解大模型怎么训练和微调大语言模型(LLM)
面试或被面试,需要考察框架面试题解析
术语卡壳术语表
数学公式看不懂数学基础速查
找数据集、找工具数据集与工具档案、精选资源清单

把这一页加书签

速查线的价值在于复用率。建议把本页(而不是任何一篇概念文)设为书签——它是全站的交换机。

两点说明 ​

路径不是死规定。 三条线的周数和顺序都是按典型背景估的:数学系出身的可以跳过数学地基,工程背景强的可以快进数据工程,产品经理转岗则应该在导读和案例上花双倍时间。判断标准永远是你能否通过每周的检验,而不是日历翻到了第几页。

注意内容的时效。 机器学习是半衰期很短的领域——榜单、模型分数、工具选型都会过期。career 模块和案例章的部分页面在 frontmatter 里标注了 dataAsOf(数据截止月份),页面顶部也会显示;引用其中的具体岗位、分数、产品功能之前,先看一眼那个日期,超过一个季度的数据请当作"趋势参考"而非"当前事实",并以官方来源复核。概念性的内容(什么是监督学习、偏差方差权衡)衰减慢得多,可以放心长期依赖。

延伸阅读 ​