Skip to content

论文地图

本页速览 把机器学习六十年发展的关键论文按主题分组排成一张可检索的地图,覆盖机器学习基础、深度学习奠基、Transformer、生成模型、强化学习、树模型与表征学习七大主题,附范式迁移时间轴、按任务查论文索引与精读泛读路线。

论文地图 ​

一句话定位:这张地图把机器学习 60 年发展中的关键论文按主题与年代排成一张可随时检索的坐标系——从 1958 年的感知机到 2022 年的 Latent Diffusion,读完这张地图,你能说出"每一篇经典论文解决了什么问题、与前后哪些工作相连、值得精读还是泛读"。

论文阅读最大的障碍不是"读不懂一篇",而是"不知道下一篇该读哪篇"。教程会按顺序教,但论文世界是按问题组织的:同一个问题(比如"如何让机器读懂图像")在 1990 年代的答案是 SVM + 手工特征,在 2012 年变成 AlexNet,在 2021 年变成 CLIP。如果你只顺着时间线读,你会迷失在"谁替代了谁"的细节里;如果你只按主题读,你会错过"为什么范式会迁移"的宏观叙事。这张地图的目的,就是把主题和时间两个维度叠在一起,让你在任何一篇论文面前都能回答三个问题:它属于哪条技术线?它处在范式演进的哪个阶段?它和哪几篇论文构成"必读链"?

地图与其他页面的分工

本站论文栏目共五页,分工不同:从这里开始 讲"为什么要读论文",阅读路径 讲"按目标怎么读",本文(论文地图) 讲"整个领域有哪些值得读的论文、它们之间什么关系",经典论文精读 逐篇深挖,前沿进展 追踪 2020 年代的新趋势。一句话:地图定坐标,精读给深度,前沿指方向。

一、这张地图怎么读 ​

在展开地图之前,先说清三条阅读约定:

  1. 编号约定:2000 年以后(arXiv 成立后)的论文,表格给出 arXiv 编号,可在 https://arxiv.org/abs/编号 免费取全文;更早的经典论文没有 arXiv 编号,表格中标注"—",出处写期刊/会议,可在参考资料中找到原文链接。
  2. 年份约定:论文年份一律指首次公开发表(会议/期刊正式发表,或 arXiv 预印本提交)的年份。例如 VAE 的 arXiv 预印本 2013 年 12 月提交、ICLR 2014 发表,表格记为 2014(预印本 2013)——标注规则比具体数字更重要。
  3. 深读约定:地图只给"一句话贡献",回答"这篇为什么值得记"。想读透一篇时,跳到经典论文精读;想追它之后的发展,用前沿进展与 FAQ 中的检索法。

三大坐标一起使用:主题决定它归哪条线,年份决定它在范式演进中的位置,重要度决定你投入多少时间。下图是这张地图的总览:

                      主题维度(七大技术线)
                    ┌──────────────────────────────┐
  时间维度 ↓        │  ① 机器学习基础               │
                    │  ② 深度学习奠基               │
                    │  ③ 注意力与 Transformer       │
                    │  ④ 生成模型                   │
                    │  ⑤ 强化学习                   │
                    │  ⑥ 树模型与集成               │
                    │  ⑦ 表征与自监督               │
                    └──────────────────────────────┘

二、按主题分组的学术地图 ​

1. 机器学习基础:三大支柱(1958–1997) ​

现代机器学习的根有三条:神经网络线(感知机及其后代)、几何线(最大间隔分类器)、统计学习线(boosting 与集成)。1990 年代之前它们分属不同学派,1990 年代在"表格数据分类"这个共同战场汇合,构成特征工程时代的全部弹药。

论文作者/机构年份出处/arXiv一句话贡献
感知机(The Perceptron)Frank Rosenblatt(康奈尔航空实验室)1958—(Psychological Review)第一个可学习的神经网络模型,证明"机器能从样本中学规则",点燃第一次 AI 热潮
SVM(Support-Vector Networks)Corinna Cortes & Vladimir Vapnik(AT&T)1995—(Machine Learning 20)最大化间隔 + 核技巧,给出特征工程时代的最强分类器,几何与统计的巅峰
AdaBoostYoav Freund & Robert Schapire(UC San Diego)1997—(JCSS 55)证明弱学习器可被"提升"为强学习器,奠定集成学习理论与实践的双重根基

为什么先读这三篇

感知机告诉你"从规则到学习"的思想转向;SVM 告诉你"特征工程时代的最优解长什么样";AdaBoost 告诉你"多个弱模型的组合可以变强"。三篇一起读,才能理解 2012 年之后深度学习为什么是革命而不是改良——它同时把"手工特征"和"浅层模型"两个前提都替换掉了。深度学习对这三条线的取代与补充,见深度学习基础。

2. 深度学习奠基:算力、结构与训练(2012–2015) ​

这一组的四篇论文分别解决深度学习的三个难题:算力怎么用(GPU)、网络怎么搭(深度与残差)、训练怎么稳(归一化)。四篇读完,你就掌握了 2010 年代深度学习的全部工程配方。

论文作者/机构年份出处/arXiv一句话贡献
AlexNetKrizhevsky, Sutskever, Hinton(多伦多大学)2012arXiv:1207.0580GPU + ReLU + Dropout 训练深度 CNN,ImageNet 错误率断崖式下降,引爆深度学习革命
VGGKaren Simonyan & Andrew Zisserman(牛津大学)2014arXiv:1409.1556用统一的 3×3 小卷积堆叠,实证"更深更强",成为后续视觉模型的通用骨架
ResNetHe, Zhang, Ren, Sun(微软亚洲研究院)2015arXiv:1512.03385残差连接让上百层网络可训练,ImageNet top-5 错误率 3.57%,首次超过人类基线
Batch NormalizationSergey Ioffe & Christian Szegedy(Google)2015arXiv:1502.03167对每层输入做归一化,极大稳定深层网络训练,让"更深"从口号变成可落地

一句话记住这一组

AlexNet 证明了"能学",VGG 证明了"要深",ResNet 证明了"深也有解",BatchNorm 证明了"训练能稳住"。 这四条合起来,就是深度学习第一次工业化的完整配方。有趣的是,ResNet 和 BatchNorm 同年出现且互相成就——没有 BatchNorm,152 层的 ResNet 很难练出来;没有残差,归一化带来的收益会被退化问题抵消。

3. 注意力与 Transformer:从组件到通用底座(2014–2020) ​

注意力机制最初只是机器翻译里的一个"对齐组件",2017 年 Transformer 把它升级为整个架构,2018 年起预训练范式接管自然语言处理,2020 年 GPT-3 用规模法则把"大力出奇迹"变成了有理论味道的实证规律。这条线是当前大语言模型(LLM)的直接祖先,机制详解见Transformer 案例与大语言模型。

论文作者/机构年份出处/arXiv一句话贡献
Neural Machine Translation by Jointly Learning to Align and TranslateBahdanau, Cho, Bengio(蒙特利尔大学)2014arXiv:1409.0473引入注意力机制让解码器动态"对齐"源句,解决长句翻译的信息瓶颈,注意力概念的源头
Attention Is All You NeedVaswani 等(Google Brain)2017arXiv:1706.03762提出纯注意力架构 Transformer,去掉循环与卷积,成为 BERT/GPT 乃至全部大模型的共同底座
BERTDevlin 等(Google)2018arXiv:1810.04805双向 Transformer + 预训练/微调范式,横扫 11 项 NLP 基准,确立"先预训练再微调"的标准流程
GPT-2Radford 等(OpenAI)2019arXiv:1902.09599更大规模的自回归语言模型展示零样本迁移潜力,第一次让"生成"而不是"填空"成为主角
GPT-3Brown 等(OpenAI)2020arXiv:2005.141651750 亿参数 + 上下文学习(in-context learning),实证"规模本身带来能力跃迁",开启规模法则叙事

一个容易混淆的点

BERT 和 GPT 走的是两条不同的预训练路线:BERT 是双向编码器,擅长"理解"(分类、抽取、检索),GPT 是自回归解码器,擅长"生成"。2020 年代的大模型竞争最终是生成路线胜出——ChatGPT 证明了"把一切任务都当作生成"是更统一的范式。这个分岔与汇合,是理解 2018 到 2024 年 NLP 史的关键线索,可对照演进简史阅读。

4. 生成模型:从对抗到扩散(2013–2022) ​

生成模型要回答的问题只有一个:给我一堆数据,能不能学会"造出同分布的新数据"? 2014 年两条路线同时出现——VAE 走隐变量 + 变分推断的"显式概率"路线,GAN 走对抗博弈的"隐式分布"路线;2020 年扩散模型以更稳定的训练和更高的样本质量终结了 GAN 在图像生成上的统治,2022 年 Latent Diffusion 把扩散搬进潜空间,让"文本画图"成为大众产品。

论文作者/机构年份出处/arXiv一句话贡献
VAE(Auto-Encoding Variational Bayes)Kingma & Welling(阿姆斯特丹大学)2014arXiv:1312.6114用变分下界训练可生成新样本的隐变量模型,隐空间生成与"重参数化技巧"的起点
GAN(Generative Adversarial Nets)Goodfellow 等(蒙特利尔大学)2014arXiv:1406.2661生成器与判别器零和博弈,从噪声直接"无中生有",掀起对抗生成研究热潮
DDPM(Denoising Diffusion Probabilistic Models)Ho, Jain, Abbeel(UC Berkeley)2020arXiv:2006.11239用逐步去噪的马尔可夫链做生成,训练稳定、样本质量高,奠定扩散生成的基础
Latent Diffusion ModelsRombach 等(LMU Munich 等)2022arXiv:2112.10752在潜空间做扩散 + 文本条件注入,训练高效可控,成为 Stable Diffusion 等图像生成工具的地基

三条路线的关系

如果 VAE 是"先压缩再还原"(有明确的隐变量与概率解释),GAN 是"造假者与鉴伪者互相进化"(没有显式概率却出奇地清晰),扩散就是"先毁掉再复原"(从纯噪声一步步去噪回数据)。2020 年代的格局是:扩散在图像上赢了,但 VAE 的隐空间思想、GAN 的对抗思想仍然活在大量新方法里——Latent Diffusion 本身就是"VAE 的潜空间 + 扩散的生成器"。前沿演化见前沿进展。

5. 强化学习:从游戏到对齐(2015–2022) ​

强化学习(RL)的独特之处在于:监督学习有标签,RL 只有"事后奖励"。这组论文展示了 RL 的两次跃迁——第一次是从"手工特征"到"深度网络读原始输入"(DQN),第二次是从"打游戏"到"对齐大模型"(RLHF)。后者直接催生了 ChatGPT,意义已经超出游戏本身。

论文作者/机构年份出处/arXiv一句话贡献
DQN(Human-level control through deep RL)Mnih 等(DeepMind)2015—(Nature 518)深度 Q 网络从原始像素学会 49 款 Atari 游戏且多数超越人类,开创深度强化学习
AlphaGoSilver 等(DeepMind)2016—(Nature 529)深度策略/价值网络 + 蒙特卡洛树搜索击败围棋世界冠军,搜索与学习的经典结合
AlphaZeroSilver 等(DeepMind)2017arXiv:1712.01815不依赖人类棋谱、纯自我对弈从零掌握围棋/国际象棋/将棋,通用游戏智能的标杆
PPOSchulman 等(OpenAI)2017arXiv:1707.06347裁剪目标的策略梯度算法,稳定、实现简单,成为策略优化的事实标准
RLHF / InstructGPTOuyang 等(OpenAI)2022arXiv:2203.02155人类反馈 + RL(以 PPO 为引擎)把大模型"对齐"到用户意图,ChatGPT 的核心技术

关于 RLHF 的定位

严格说,InstructGPT(RLHF 的代表论文)是"大模型 + 强化学习"的交叉产物:预训练负责"会说话",RLHF 负责"说人话"。它同时属于[注意力与 Transformer 组]和本组的叙事——这正是地图的价值:一篇论文可以跨越多个主题,读的时候要同时挂靠两条线。 对"对齐"前沿的追踪见前沿进展。

6. 树模型与集成:表格数据的常青树(2001–2017) ​

这一组可能是"最容易被深度学习遮蔽"的重要地图。事实是:在结构化表格数据(金融风控、广告点击、销售预测)上,梯度提升树至今仍是实战中的王者——Kaggle 历年竞赛的赢家大量依赖 XGBoost/LightGBM/CatBoost,深度学习反而常常打不过它们。

论文作者/机构年份出处/arXiv一句话贡献
Random ForestsLeo Breiman(UC Berkeley)2001—(Machine Learning 45)自助采样 + 随机特征子集集成决策树,抗过拟合、几乎免调参,至今是万能基线
XGBoostTianqi Chen & Carlos Guestrin(华盛顿大学)2016arXiv:1603.02754二阶梯度 + 正则化的 GBDT 工程实现,2015–2020 年 Kaggle 与工业界的统治级工具
LightGBMKe 等(Microsoft)2017arXiv:1706.08374直方图分桶 + 叶子生长策略,训练快、内存省,海量表格数据的标配
CatBoostProkhorenkova 等(Yandex)2017arXiv:1706.09516对称树 + 有序提升,原生处理类别特征、不易过拟合,调参负担最小

学树模型的三条理由

第一,它们是工程落地的主力——大多数公司的核心营收模型是树模型而不是大模型;第二,它们是理解"偏差-方差权衡""集成""特征重要性"的最佳教材,概念最直观;第三,它们是深度学习的对照系——知道树模型在表格数据上更强,你才不会"无脑上深度学习"。本站[核心知识]中关于评估与正则化的内容,常以树模型为样例。

7. 表征与自监督:让模型自己找监督(2013–2021) ​

这一组回答"没有标签怎么办"。自监督学习 = 从数据自身构造监督信号:Word2Vec 让"单词在上下文中的出现"成为监督,CLIP 让"图像与其配对的文本"成为监督,SimCLR 让"同一图像的两个增强视图"成为监督。它们共同把机器学习从"标签驱动"推向"数据驱动",是大模型"预训练"能成立的哲学基础。

论文作者/机构年份出处/arXiv一句话贡献
Word2VecMikolov 等(Google)2013arXiv:1301.3781用神经网络学习分布式词向量,展示"king − man + woman ≈ queen"的语义算术,NLP 表征学习的源头
SimCLRChen 等(Google)2020arXiv:2002.05709对比学习框架:无标签图像也能学到强视觉表征,刷新自监督视觉性能
CLIPRadford 等(OpenAI)2021arXiv:2103.00020用 4 亿图文对做对比学习,视觉模型获得"看图说人话"的零样本迁移能力,打通文本与图像两模态

为什么自监督是 2020 年代的暗线

监督学习的天花板是标签:人工标注贵、错、覆盖不全。自监督把"下一句是什么""这个输入加了噪声还是同一张图"这类永远免费、无限量的任务变成预训练目标,模型先学会语言的句法、图像的结构,再用少量标签微调。BERT 的"遮词填空"、GPT 的"预测下一个词"、CLIP 的"图文匹配",本质都是同一种思想的不同实例。 术语速查见术语表。

三、范式迁移时间轴:规则 → 特征 → 表征 → 规模 ​

把第二节的七大主题投影到时间轴上,会出现一次明确的"范式迁移":机器学习对"智能从哪来"的答案,经历了四次重大改口。

   规则时代            特征工程时代         表征学习时代          规模时代
   1950s–1980s         1990s–2000s         2012–2018            2018–今
────────────────────┬────────────────────┬────────────────────┬────────────────────
 智能 = 规则+知识    │ 智能 = 特征+调参    │ 智能 = 结构+数据    │ 智能 = 规模+对齐
 专家系统、逻辑推理   │ 手工特征 + 浅层模型  │ 深度网络自动学特征  │ 预训练大模型
 知识库、搜索        │ SVM / AdaBoost     │ CNN / RNN / Trans   │ BERT / GPT / 扩散
 人写规则            │ 随机森林           │                    │
                    │ 人写特征            │ 网络学特征          │ 数据+算力+对齐

每个时代的关键论文节点如下(年份为首次公开发表):

1958 ─ 感知机                                   (规则时代里"从数据学习"的第一声)
1986 ─ 反向传播(Rumelhart, Hinton, Williams)
1995 ─ SVM                                      (特征工程时代的巅峰)
1997 ─ AdaBoost
2001 ─ 随机森林
2006 ─ 深度信念网络(Hinton 等)                 (深度学习复兴的先声)
2012 ─ AlexNet ◀────────────────────────────   表征学习时代的分水岭
2014 ─ Seq2Seq / GAN / VAE
2015 ─ ResNet / DQN / BatchNorm
2017 ─ Transformer / PPO / AlphaZero
2018 ─ BERT / GPT-1 ◀──────────────────────   规模时代的开启
2020 ─ GPT-3 / DDPM
2022 ─ InstructGPT(RLHF)/ Latent Diffusion ◀ 生成式 AI 走向大众
2023 ─ GPT-4、多模态大模型                      通用基础模型时代

这条时间轴最重要的观察只有两点:

  • 2012(AlexNet)和 2018(BERT)是两个分水岭。 2012 年之前,获胜方在"特征工程";2012 年之后,获胜方在"自动学特征的表征"。2018 年之后,"规模 + 数据 + 算力"取代"任务专用模型",成为新的游戏规则。完整叙事见演进简史。
  • 每一次范式迁移都没有"消灭"上一代,而是把上一代降级为子问题。 特征工程变成"表征学习的一个环节"(数据预处理、Prompt 设计),SVM/树模型依然活在表格数据战场,规则甚至以"提示词约束"的形式回归。地图上不存在"被淘汰的论文",只存在"换了战场的论文"。

四、按任务查论文 ​

这张地图按主题组织,但实际工作时你通常是按任务找论文的。下表把七大主题里的代表论文按"我要解决什么问题"重新索引:

我要做的任务按顺序读这几篇读完你得到什么
图像分类AlexNet → ResNet →(追前沿可读 ViT 系工作)从卷积到深度的完整演进
目标检测Faster R-CNN(arXiv:1506.01497)→ YOLO(arXiv:1506.02640)两阶段 vs 单阶段的路线之争
图像分割U-Net(arXiv:1505.04597)→(后续 Mask R-CNN 等)编码器-解码器 + 跳跃连接的结构模板
机器翻译Seq2Seq(arXiv:1409.3215)→ Bahdanau Attention → Transformer"编码-解码"如何升级为"全注意力"
文本/代码生成GPT-2 → GPT-3 → InstructGPT(RLHF)生成模型 + 对齐的完整链条
图像生成GAN → DDPM → Latent Diffusion对抗到扩散的生成路线变迁
推荐系统Neural Collaborative Filtering(arXiv:1708.05031)→(工业界再学 XGBoost/LightGBM 做排序)协同过滤的神经网络化
表格数据建模随机森林 → XGBoost → LightGBM/CatBoost从集成原理到工程化选型

关于任务表的两点提醒

第一,表中少数论文(Faster R-CNN、YOLO、U-Net、Seq2Seq、NCF)没有进入第二节的主表格,它们同样是本领域必须知道的名字——任务索引补上了"主题地图"与"任务实践"之间的缝隙。第二,任务不等于模型:同一个任务在不同的数据形态下最优模型不同(图像用 CNN 系、表格用树系),选型时应回到深度学习基础建立的数据类型视角。

五、如何使用这张地图 ​

1. 精读核心:八篇必读 ​

读论文最怕"平均用力"。建议把有限时间集中在八篇"枢纽论文"上——它们各自是某条技术线必经的路口,读透之后,其他论文的摘要几乎都能看懂。按推荐顺序:

顺序论文精读理由
1Attention Is All You Need当代一切大模型的架构源头,先读它等于拿到 2020 年代的地图钥匙
2AlexNet深度学习革命的引爆点,篇幅短、方法直观,适合建立"论文怎么读"的第一感
3ResNet残差连接影响一切深层网络,理解它才能理解"为什么现在的模型都能几百层"
4BERT预训练/微调范式 + 双向注意力,NLP 转向大模型的转折点
5GPT-3规模法则与上下文学习的奠基实证,读它是为理解 ChatGPT 作思想准备
6DDPM扩散模型的原点,当前图像/视频/音频生成技术的共同根基
7XGBoost工程界使用面最广的论文之一,也是"读论文→用对工具"的最佳示范
8PPO 或 InstructGPT(二选一)想深入 RL 读 PPO,想理解 ChatGPT 的"对齐"读 InstructGPT

这八篇的逐篇深读,见经典论文精读;读法上的方法论(怎么记笔记、读不懂怎么办)见阅读纪律与 FAQ。

2. 泛读周边:一个主题一条链 ​

不是每篇论文都值得精读。对第二节地图里的其余论文,用"三件套泛读法"处理:摘要(1 分钟)→ 核心图(2 分钟)→ 结论与局限(2 分钟),产出三行笔记:"解决什么问题 / 核心方法一句话 / 自述局限"。这样把七大主题各读成一条"链",你的地图就从"七个孤岛"变成"一张网络"。

3. 按需检索:四步法 ​

遇到一个具体问题(比如"我要做目标检测")时,按四步用这张地图:

① 定位任务 → 查第四节"按任务查论文"表格,找到入口论文
② 追源头   → 读入口论文的 References,找到它站在哪些工作上(溯源)
③ 追下游   → 用 Google Scholar / Semantic Scholar 查"引用它的论文",找到最新方法(流向)
④ 记节点   → 把新论文挂到第二节地图的某个主题 + 时间轴上的某年

做完一轮,你的个人地图就比本文更大了——这本来就是地图的正确用法:先继承,再扩张。

4. 与本站其他资源的配合 ​

六、延伸阅读 ​

参考资料 ​

以下资料均为真实公开资源,供进一步自学。所有 arXiv 编号均可直接访问 https://arxiv.org/abs/<编号>: