Skip to content

术语表

本页速览 机器学习领域核心术语表:基础概念、数据、模型与算法、深度学习、评估与指标、生产与可信 ML 等 60+ 术语的准确定义与辨析。

术语表 ​

本表收录机器学习领域的核心术语,按主题分为七组:基础概念、数据、模型与算法、深度学习、生成式与 LLM、评估与指标、生产与可信 ML。每条术语给出中文名、英文原名与定义;容易混淆的术语对单独做了辨析。

使用建议

术语不必按顺序读。建议先读「基础概念」建立词汇骨架,然后在阅读其他章节遇到生词时回来查阅。加粗的站内链接指向该术语的深入讨论页。

基础概念 ​

机器学习(machine learning, ML) 让计算机从数据中自动发现规律并用于预测/决策的技术。核心是"从数据生成规则"而非"人写规则"。四要素:任务 T、经验 E、性能 P、提升机制。详见什么是机器学习。

人工智能(artificial intelligence, AI) 让机器完成需要人类智能的任务的总目标。机器学习是 AI 的一个子领域(当前最成功的一个),规则系统、知识图谱等也属于 AI 但不是 ML。详见ML vs AI 辨析。

深度学习(deep learning, DL) 用多层神经网络进行表征学习的机器学习子领域。核心是端到端学习特征:浅层学低级特征,深层学高级语义。详见深度学习基础。

数据科学(data science, DS) 用数据回答业务问题、支持决策的完整流程学科:采集清洗 → 分析 → 建模 → 沟通。机器学习是其中的建模环节。

监督学习(supervised learning) 用带标签数据 (x, y) 学习 x→y 映射的范式,分分类、回归、排序。详见监督学习。

无监督学习(unsupervised learning) 只用无标签数据 x 发现数据结构的范式:聚类、降维、异常检测、关联规则。详见无监督学习。

强化学习(reinforcement learning, RL) 智能体通过与环境交互、依据奖励信号学习最优决策序列的范式。核心难点是信用分配与探索-利用权衡。详见强化学习。

特征(feature) 模型输入的一个可度量属性,即"原始数据变成的数值表示"。特征的质量决定模型上限。

标签(label) 监督学习中的标准答案 y,与输入 x 配对构成训练样本。

泛化(generalization) 模型对未见数据表现好的能力。机器学习的一切目标都可归结为"泛化"——训练集表现好不等于学会。

过拟合(overfitting) 模型把训练数据中的噪声也当成规律学习,导致训练好、泛化差。详见过拟合与正则化。

欠拟合(underfitting) 模型容量不足,训练数据都拟合不好(高偏差)。与过拟合相对。

偏差-方差权衡(bias-variance tradeoff) 预测误差 = 偏差² + 方差 + 噪声。模型越复杂偏差越低方差越高,最优复杂度在中间。详见模型评估与验证。

正则化(regularization) 一系列"阻止模型把噪声学进去"的技术:L1/L2、Dropout、早停、数据增强。本质是"给模型复杂度加税"。

模型(model) 学习算法在数据上训练得到的参数化函数(如线性回归的 w、b),是"数据生成的规则"的载体。

算法(algorithm) 学习过程的数学流程(如梯度下降、EM),负责从数据中求解模型参数。

超参数(hyperparameter) 训练前设定的参数(学习率、树深度、λ),不由数据学习,靠验证集搜索确定。详见调参与超参数优化。

数据 ​

训练集 / 验证集 / 测试集(train/validation/test set) 三份数据:训练集训参数,验证集选超参,测试集最终评估。测试集在任何迭代中都不能碰。

数据泄露(data leakage) 测试集信息混入训练过程导致离线指标虚高、上线崩盘。六大来源:全局统计、未来信息、目标泄漏、重复样本、分组泄漏、增强泄漏。详见数据与数据工程。

类别不平衡(class imbalance) 正负样本比例悬殊,导致准确率失效、模型偏向多数类。对策:重采样、类别权重、改指标。

数据增强(data augmentation) 用先验知识制造更多训练样本(图像翻转/裁剪、噪声注入),是"免费扩数据"的正则化手段。

特征工程(feature engineering) 把原始数据加工成模型能有效利用的数值特征的全过程:缺失值、编码、缩放、组合、选择。详见特征工程。

特征存储(feature store) 统一训练/推理特征定义与计算的系统,解决"训练特征与线上特征不一致"的工程事故。详见MLOps。

数据漂移(data drift) 线上输入特征分布随时间变化导致模型性能下降。检测:PSI、KS 检验。

概念漂移(concept drift) x→y 的映射关系本身发生变化(如政策变化改变风控规律),比数据漂移更难检测。

模型与算法 ​

线性回归(linear regression) 假设 y = w·x + b 的回归模型,最小二乘/梯度下降求解。一切回归任务的默认基线。详见线性模型。

逻辑回归(logistic regression) 线性输出套 sigmoid 得概率 + 交叉熵损失的分类器。名字带"回归",实为最重要的分类基线。

决策树(decision tree) 按特征值递归划分样本的 if-then 规则树。可解释、免归一化、天然处理类别特征。

随机森林(random forest) 多棵决策树的 bagging 集成:每棵树用随机子样本+随机特征子集训练,投票/平均输出。稳健、抗过拟合。

梯度提升(gradient boosting) 逐棵拟合残差的加法集成:GBDT → XGBoost → LightGBM。表格数据的事实霸主。详见树模型与集成学习。

支持向量机(support vector machine, SVM) 用核函数映射高维空间找最大间隔超平面。小样本高维场景仍有价值,非结构化数据已被深度学习取代。

K 近邻(K-nearest neighbors, KNN) 按距离找最近的 K 个样本投票/平均。简单但预测慢(要算距离)、高维失效。

聚类(clustering) 无监督地把相似样本分组:K-Means、DBSCAN、层次聚类、GMM。详见无监督学习。

降维(dimensionality reduction) 把高维数据映射到低维保留主要结构:PCA(线性)、t-SNE/UMAP(非线性可视化)、自编码器。

主成分分析(principal component analysis, PCA) 找方差最大的正交方向投影数据。线性降维默认选择,使用前必须标准化。

异常检测(anomaly detection) 找与大多数样本显著不同的点:隔离森林、LOF、One-Class SVM、自编码器重建误差。

集成学习(ensemble learning) 组合多个模型提升性能:bagging(并行、降方差)、boosting(串行、降偏差)、stacking(元学习)。

贝叶斯方法(Bayesian methods) 把参数当随机变量、用先验+似然求后验的统计框架:朴素贝叶斯、高斯过程、贝叶斯优化。

深度学习 ​

神经网络(neural network) 由神经元(加权求和+激活函数)分层连接的网络,通过反向传播训练。详见深度学习基础。

反向传播(backpropagation) 用链式法则把损失对每层参数的梯度逐层传回的算法,配合梯度下降更新参数。深度学习训练的引擎。

激活函数(activation function) 引入非线性的函数(ReLU/GELU/sigmoid/softmax),是"深网络有用"的数学前提。

卷积神经网络(convolutional neural network, CNN) 专为图像设计的网络:卷积核滑动提取局部特征、参数共享、池化压缩。残差连接让其可到 150+ 层。详见CNN。

循环神经网络(recurrent neural network, RNN) 按时间步处理序列的网络,LSTM 用门控解决长期依赖。2020 年代已被 Transformer 取代。

注意力机制(attention) 处理序列时按"相关性权重"聚合信息的机制:Q/K/V 三向量,权重 = softmax(Q·Kᵀ/√d)。详见Transformer。

Transformer 完全基于注意力、抛弃循环的序列架构(2017)。并行性强、长程依赖建模好,是 BERT/GPT/一切 LLM 的地基。

自注意力(self-attention) 序列内部 token 两两交互的注意力:每个词都关注上下文中的其他词。多头注意力并行捕捉不同关系。

位置编码(positional encoding) 给并行计算的 Transformer 补充顺序信息的机制(正余弦、可学习、RoPE)。

残差连接(residual connection)输出 = F(x) + x 的跳连结构,解决深层网络退化/难训练问题,现代深层网络标配。

归一化层(normalization layer) 稳定训练的技术:BatchNorm(沿 batch 维,CNN 用)、LayerNorm(沿特征维,Transformer 用)。

嵌入(embedding) 把离散对象(词、用户、物品)映射成稠密向量的表示,语义相近的对象向量相近。

迁移学习(transfer learning) 把预训练模型(ImageNet/BERT)的知识迁移到目标任务:特征提取或微调。小数据项目的核心套路。

微调(fine-tuning) 在预训练模型基础上用小学习率在任务数据上继续训练。

损失函数(loss function) 衡量预测与标准答案差距的函数(MSE/交叉熵/Huber),训练的优化目标。与任务输出分布匹配是关键。

优化器(optimizer) 梯度下降的具体实现:SGD、Momentum、Adam、AdamW。深度学习默认 AdamW,大模型标配。详见优化。

学习率(learning rate) 梯度下降每步的步长,最重要的超参数。过大震荡发散,过小龟速收敛。

梯度消失 / 梯度爆炸(vanishing/exploding gradient) 深层网络梯度逐层消失(浅层不更新)或爆炸(参数发散)。对策:ReLU、残差、归一化、梯度裁剪。

Dropout 训练时随机丢弃部分神经元的正则化技术,让网络学到冗余表征,等价于"模型内集成"。

早停(early stopping) 监控验证 loss,不再下降就停止训练并取最优模型。免费的正则化,深度学习默认开启。

量化(quantization) 把模型权重从 FP32 降到 FP16/INT8/INT4,显存减半、推理加速,精度损失小。部署优化首选。

蒸馏(distillation) 用大模型(教师)的输出教小模型(学生),让小模型逼近大模型效果。降本增效的常用手段。

生成式与 LLM ​

生成式模型(generative model) 学习数据分布 P(x)、能从中采样出新样本的模型:VAE、GAN、扩散模型、自回归模型。详见生成式模型。

GAN(生成对抗网络) 生成器与判别器对抗训练:G 造假的骗过 D,D 分辨真假。生成清晰但训练不稳定、易模式崩塌。

扩散模型(diffusion model) 先给数据加噪到纯噪声、再学逐步去噪还原。当前文生图/音生图的事实标准(Stable Diffusion、DALL·E)。详见扩散模型。

自回归生成(autoregressive generation) 逐 token 预测下一个 token 的生成方式,GPT 系列的核心。见大语言模型。

大语言模型(large language model, LLM) 基于 Transformer 解码器、在超大规模语料上预训练的生成式模型,涌现出理解、推理、对话能力。

预训练(pretraining) 在海量无标注语料上训练基础能力(学语言/图像表征)的阶段。产出基础模型。

指令微调(supervised fine-tuning, SFT) 用"指令-回答"对微调,让模型学会遵循指令。

RLHF(reinforcement learning from human feedback) 用人类偏好训练奖励模型、再用强化学习(PPO)对齐模型行为的流程。ChatGPT 的关键技术。

DPO(direct preference optimization) 直接基于偏好对微调的简化对齐方法,无需训练奖励模型,开源社区主流。

上下文学习(in-context learning) 不更新权重、只靠输入提示(零样本/少样本示例)让模型完成任务的能力。

思维链(chain-of-thought, CoT) 提示模型"一步步思考再回答",显著提升推理任务表现。

检索增强生成(retrieval-augmented generation, RAG) 先检索再生成的范式:向量检索私有/实时知识拼入上下文,解决知识过时、幻觉、无私有数据三大短板。

LoRA(low-rank adaptation) 只训练低秩适配矩阵的微调方法,冻结原权重,单卡可跑,微调事实标准。

幻觉(hallucination) 生成式模型编造不存在的"事实"——它学的是"像人话的序列"而非"事实数据库"。缓解:RAG、引用、人类复核。

提示词工程(prompt engineering) 设计输入提示(指令、示例、格式约束)来引导模型输出质量的技术。

温度(temperature) 控制生成随机性的采样参数:低温度更确定(事实类),高温度更多样(创意类)。

Token(词元) 模型处理文本的基本单位(约 0.7 个英文词 / 1 个汉字左右),计费与上下文窗口都以 token 计。

评估与指标 ​

准确率(accuracy) 预测正确的比例。类别不平衡时是陷阱指标(全猜多数类也有高准确率)。

精确率 / 召回率(precision/recall) 精确率 = 预测为正中的真正比例(惩罚误报);召回率 = 真正正样本找回的比例(惩罚漏报)。业务选哪个取决于"哪类错误更贵"。

F1 精确率与召回率的调和平均,两者同等重视时的折中指标。

混淆矩阵(confusion matrix) TP/FP/FN/TN 四格表,一切分类指标的起点。

ROC / AUC ROC 曲线下面积 = 随机正样本得分高于随机负样本的概率。与阈值无关、对不平衡相对不敏感。

均方误差(mean squared error, MSE) 回归指标,平方惩罚、对异常值敏感、可导性好。

R²(决定系数) "模型解释了多少方差"的回归指标,与均值基线比较,可能为负。

交叉验证(cross-validation) K 折轮流训练/验证,报告平均与方差,小数据上比单次留出更可靠。变体:StratifiedKFold、GroupKFold、TimeSeriesSplit。

A/B 测试(A/B testing) 线上把用户随机分两组,对比新旧模型/版本的真实业务效果。离线指标的最终裁判。

pass@k 采样 k 次至少成功一次的概率指标,衡量模型能力上限(LLM 评测常用)。

生产与可信 ML ​

MLOps(machine learning operations) 把 ML 系统从 notebook 变成生产稳定服务(实验管理、模型注册、部署、监控、再训练)的工程实践。详见MLOps。

实验管理(experiment tracking) 记录每次实验的代码/数据/超参/指标,保证可复现。工具:MLflow、W&B。

模型注册(model registry) 模型版本化、状态管理、审批上线、可回滚。工具:MLflow Registry。

在线推理 / 批处理推理(online/batch inference) 实时 API 响应 vs 定时批量打分。延迟敏感选在线,时效不敏感选批处理(省 90% 成本)。

可解释性(interpretability) 理解"模型为什么这么判断":全局(特征重要性)、局部(SHAP、LIME)、透明模型(线性/树)。详见可解释性与公平性。

SHAP 基于博弈论 Shapley 值解释模型输出的方法,局部解释事实标准。计算贵,用近似实现。

公平性(fairness) 模型是否对不同群体一视同仁:人口均等、机会均等、校准均等(三者不可同时满足,需业务定义)。偏见主要来自数据。

提示注入(prompt injection) 攻击者把恶意指令藏进模型会读到的内容(网页、文档、工具输出),诱导模型违背原定任务。LLM 应用特有安全威胁。

护栏(guardrail) 对模型输入输出的程序化检查与拦截:内容过滤、格式校验、动作白名单。

易混淆辨析 ​

机器学习 / 深度学习 / 强化学习

机器学习是"从数据学规律"的总称;深度学习是其中用多层神经网络的分支(图像/文本/语音);强化学习是第三种范式(学决策序列),与"深度学习"是正交的维度——深度强化学习(DQN/PPO)才把两者结合。三者关系见ML vs AI 辨析。

准确率 / 精确率 / 召回率

准确率看整体(猜对比例);精确率看预测为正的可信度(惩罚误报);召回率看真正正样本的找回率(惩罚漏报)。业务例子:垃圾邮件重精确率(别误杀重要邮件),癌症筛查重召回率(别漏病人)。指标选择见模型评估与验证。

偏差 / 方差 / 过拟合 / 欠拟合

欠拟合 = 高偏差(模型太简单学不会);过拟合 = 高方差(模型太复杂记住了噪声)。两者是同一个权衡轴的两端,正则化是把指针从"过拟合端"往回调的旋钮。

微调 / RAG / 提示工程

三者是 LLM 落地的三件套,解决不同问题:提示工程改"输入"(零成本,简单任务);RAG 加"知识"(事实/私有/实时问题);微调改"行为"(风格/格式/领域行为)。知识类问题用 RAG,行为类问题用微调——用微调喂知识是常见误区。

数据漂移 / 概念漂移 / 分布外

数据漂移:输入分布变了(年龄分布变了);概念漂移:规律本身变了(特征→结果关系失效);分布外(OOD):遇到训练时从未见过的输入类型。三者都是"模型过期"的原因,监控与再训练是对策。

延伸阅读 ​