外观
演进简史
机器学习不是一夜之间爆发的。过去七十年里它经历了三次热潮与两次寒冬,每次"冷"都不是运气差,而是当时的模型容量与算力/数据之间的错配。理解这条起落线,比背一串年份重要得多——它能让你看清今天的大模型热潮处在历史的什么位置。
一、三段式速览
text
1950s─1980s 符号主义时代:人写规则,机器推理 → 第一次寒冬(专家系统衰退)
1980s─2000s 统计学习时代:机器从数据中学规律 → 第二次寒冬(深度学习算力不足)
2012─至今 深度学习时代:算力×数据×规模法则 → 大模型浪潮(2022 起爆发)每次跃迁的本质,都是"同一批问题换了一套解题范式":规则 → 特征工程 → 表征学习 → 规模法则。
二、前深度学习时代(1956–2011)
1956:达特茅斯会议,AI 诞生
"人工智能"这个词诞生于 1956 年夏天达特茅斯学院的一场会议。与会者包括后来被称为"AI 之父"的 McCarthy、Minsky、Shannon 等人。会议提案里写着一个乐观到今天的眼光看都觉得惊人的目标:"让机器使用语言、形成抽象概念、解决只有人类能解决的问题"。这个目标至今未完全实现——记住这一点,能帮你对"AI 已死/AGI 已来"的极端叙事保持冷静。
1957–1969:感知机与第一次热潮
1957 年,Frank Rosenblatt 发明感知机(Perceptron)——第一个能"从样本中学习"的神经网络雏形,在模拟器上展示了学习能力,媒体开始渲染"会思考的机器"。热潮在 1969 年被 Minsky & Papert 的《Perceptrons》一书泼了冷水:他们严格证明了单层感知机连 XOR(异或)都表示不了。这不是神经网络不行,而是"单层"不行——但这个结论被误读为"神经网络死路一条",第一次 AI 寒冬开始。多层神经网络的理论(反向传播)要等到 1986 年才由 Rumelhart、Hinton、Williams 重新系统化。
1960s–1980s:专家系统与第二次热潮
寒冬期的主流是符号主义:把专家知识写成 if-then 规则,构建专家系统(expert system)。1980 年代商业上大获成功(如 DEC 公司的 XCON 配置系统每年节省数千万美元),第二次 AI 热潮到来。但专家系统的致命弱点是:规则靠人写,无法覆盖真实世界的开放性问题——知识工程瓶颈(knowledge acquisition bottleneck)让维护成本爆炸,1980 年代末专家系统泡沫破裂,第二次 AI 寒冬开始。
1980s–2000s:统计学习复兴
在神经网络和专家系统相继受挫的背景下,统计学习异军突起,奠定了今天"机器学习"学科的正统地位:
- 1986:反向传播(Backpropagation)系统化,多层感知机可训练;
- 1995:Vapnik 提出支持向量机(SVM),以严格的统计学习理论(VC 维、结构风险最小化)成为经典方法之王;
- 1997:Freund & Schapire 提出 AdaBoost,boosting 思想诞生,后来演化成 XGBoost、LightGBM 等表格数据霸主;
- 2001:Breiman 提出随机森林,bagging + 决策树的组合在实用中极其稳健;
- 2006:Hinton 发表深度信念网络(DBN)论文,"深度学习"一词开始被使用——但受限于算力,尚未引爆。
这一时期的共识是"特征工程决定上限":谁手工设计的特征好,谁的模型就好。这个共识在 2012 年被彻底打破。
三、深度学习革命(2012–2017)
2012:AlexNet——引爆点
2012 年 ImageNet 竞赛(ILSVRC)上,Alex Krizhevsky 的 AlexNet(8 层 CNN)把 top-5 错误率从 26.2% 一举降到 15.3%,碾压第二名近 10 个百分点。它胜出的三大支柱:GPU 并行计算(当时用两块 GTX 580)、ReLU 激活函数、Dropout 正则化 + 数据增强。注意:CNN 本身不是新东西(LeNet 1998 年就有了),2012 年的突破是算力终于跟上了模型——这正是"技术突破 = 模型 × 算力 × 数据"的第一次完整兑现。
2014–2016:深度学习的黄金三年
- 2014:GAN(Goodfellow)提出,生成式建模新范式;VGG/GoogLeNet 把 CNN 加深加宽;
- 2015:ResNet 用残差连接把网络做到 152 层,top-5 错误率 3.57% 首次超过人类水平(约 5.1%)——"残差"这一招解决了深层网络难以训练的问题,成为此后所有大网络的标配;同年 AlphaGo 论文发表,2016 年 3 月 AlphaGo 4:1 战胜李世石,AI 第一次在公众层面引爆"机器学习";
- 2014–2017:序列建模从 RNN/LSTM 走向注意力机制。2014 年 Bahdanau 提出 attention;2017 年 Vaswani 等人发表 《Attention Is All You Need》,Transformer 诞生,为 2018 年起的 NLP 革命埋下引信。
这段时期的主题可以概括为:图像领域 CNN 称王,序列领域 RNN 挣扎,注意力开始登场。
四、预训练与大模型时代(2018–至今)
2018–2019:预训练范式确立
- 2018:BERT(3.4 亿参数,Transformer 编码器,双向预训练 + 微调)横扫 11 项 NLP 基准。BERT 确立了"预训练 + 微调"(pretrain-finetune)范式:先在无标注语料上预训练(学语言),再在小数据集上微调(学任务)。GPT-1(1.1 亿参数,单向 Transformer 解码器)同年提出"生成式预训练"路线。
- 2019:GPT-2(15 亿参数)因"太危险"延迟发布,媒体第一次热议大模型的生成能力;BERT 家族(RoBERTa、ALBERT)成为 NLP 事实标准。
2020:规模法则(Scaling Laws)确立
GPT-3(1750 亿参数)论文《Language Models are Few-Shot Learners》发布,展示了一个此前被认为是幻觉的结论:模型大到一定程度,仅凭提示(few-shot)就能完成未见过的任务。Kaplan 等人同期发表的《Scaling Laws for Neural Language Models》从实证上给出了"损失随参数/数据/算力呈幂律下降"的规律——"大力出奇迹"第一次有了数学形式。这条规律后来被 Chinchilla(2022)修正为"数据和参数要同步扩"。
2022–2023:ChatGPT 与对话式 AI 爆发
- 2022 年 11 月:OpenAI 发布 ChatGPT(GPT-3.5 + RLHF 对齐),两周内用户破百万,成为史上增长最快的消费应用。**RLHF(基于人类反馈的强化学习)**让模型"学会对话",是这一波产品爆发的技术关键;
- 2023 年 3 月:GPT-4 发布,在多类专业考试中达到人类前 10% 水平;此后各家(Anthropic Claude、Google Gemini、Meta Llama 等)加入竞赛,开源社区(Llama、Mistral、Qwen)快速追赶。
2023–2026:多模态与 Agent 时代
- 2023–2024:多模态大模型(GPT-4V、Gemini、Claude 3)统一文本/图像/音频;开源模型追平闭源一代之差的局面形成;
- 2024–2025:AI Agent 浪潮——大模型从"聊天"走向"干活":Claude Code、Cursor、OpenHands 等 agent 类产品爆发,模型外包一圈 harness(工具、循环、权限)成为主角;RAG、微调、蒸馏成为企业落地的三板斧;
- 2025–2026:推理模型(o1/o3、DeepSeek-R1、Claude 等)用"思维链 + 强化学习"把推理能力提升到新台阶;行业从"拼参数"转向"拼推理效率与工程化"。
五、两条贯穿始终的主线
回顾七十年,所有起落都能归到两条主线:
主线一:知识从哪来? 规则(人写)→ 特征(人设计)→ 表征(模型自学)→ 规模(数据+算力堆叠)。每一次跃迁都是把"人工"再往前推一步。今天 LLM 的"in-context learning"(上下文学习)已经是"连任务定义都由数据提供"——这条线走到极致的表现。
主线二:瓶颈在哪? 每一次寒冬都是同一个公式的失衡:
模型能力 = 算法 × 算力 × 数据感知机死于算力与层数,专家系统死于数据覆盖不全,2000 年代的深度学习死于算力不足。2020 年代的大模型是三者同时充裕的结果。所以判断一项技术"会不会起",看的是三者中最短的那块板,而不是最长的。
历史给今天的三个提醒
- 热度不等于成熟:1960s 和 1980s 也有过"AI 无所不能"的媒体叙事,泡沫破裂后剩下的是真本事;
- 范式不会简单重复:今天的大模型和当年的专家系统共享"数据/知识瓶颈"的隐忧,但规模法则和 RLHF 提供的路径是历史上前所未有的;
- 技术史是渐进的:Transformer 的注意力机制、ResNet 的残差、反向传播——今天的每个"奇迹"都能在历史上找到它的零件。读论文时带着这条时间线,你会看得更清楚。
延伸阅读
- 什么是机器学习——本文结论的概念底座
- 总体架构解剖——今天一个 ML 系统的完整骨架
- 经典论文精读——本历史中关键节点的原始论文
- 大语言模型(LLM)——最近五年的深度展开
- Transformer 与 NLP——2017 年至今的主线技术
- 前沿进展——从历史看未来
参考资料
- McCarthy et al. A Proposal for the Dartmouth Summer Research Project on Artificial Intelligence(1955) —— AI 诞生文件
- Rosenblatt. The Perceptron(1958)
- Minsky & Papert. Perceptrons(1969) —— 第一次寒冬的理论源头
- Rumelhart, Hinton, Williams. Learning representations by back-propagating errors(Nature, 1986) —— 反向传播系统化
- Cortes & Vapnik. Support-Vector Networks(Machine Learning, 1995) —— SVM 奠基
- Krizhevsky et al. ImageNet Classification with Deep CNNs(NeurIPS 2012) —— 深度学习引爆点
- He et al. Deep Residual Learning(CVPR 2016) —— ResNet 超过人类基线
- Vaswani et al. Attention Is All You Need(NeurIPS 2017) —— Transformer
- Devlin et al. BERT(NAACL 2019)
- Brown et al. Language Models are Few-Shot Learners(NeurIPS 2020) —— GPT-3 与规模法则
- Kaplan et al. Scaling Laws for Neural Language Models(2020)
- Hoffmann et al. Training Compute-Optimal LLMs(Chinchilla, 2022)