外观
大语言模型(LLM)
概念定义:预测下一个词的规模奇迹
大语言模型(Large Language Model, LLM)是基于 Transformer 解码器、在超大规模语料上预训练的生成式模型(架构见Transformer 与 NLP)。训练目标朴素得惊人——预测下一个 token:
输入: "中国的首都是" → 模型输出: "北京"(下一个 token 的概率分布)但"预测下一个词"在规模加持下涌现出翻译、摘要、推理、编程、对话能力——这就是规模法则(Scaling Laws):模型能力随参数、数据、算力按幂律增长,且很多能力在某个规模阈值后突然涌现(emergence)。2020 年 GPT-3(1750 亿参数)证明了这条路,2022 年 ChatGPT 把它变成了产品。
二、LLM 是怎么炼成的:三段式
阶段一:预训练(Pretraining)
在数万亿 token 的互联网语料(网页、书籍、代码、论文)上做"下一个词预测"。
- 成本:数十亿~数亿美元 GPU 算力(GPT-4 级别),只有少数大厂玩得起;
- 数据:质量 > 数量(2024 年后"数据诅咒"——低质数据太多会拖累模型,见数据工程);
- 产物:基础模型(base model)——"会说话但不好用":能续写,但不会遵循指令、可能输出有害内容。
阶段二:指令微调(SFT)
用"指令-回答"对(人工编写或蒸馏)微调,让模型学会遵循指令:
用户: "用一句话解释什么是机器学习"
助手: "机器学习是让计算机从数据中自动学习规律的技术……"阶段三:对齐(RLHF / DPO)
让模型输出的价值观与人类偏好一致。**RLHF(基于人类反馈的强化学习)**三步走:
① 收集人类对多个回答的偏好排序
② 训练奖励模型(reward model):学会"哪个回答更好"
③ 用 PPO 强化学习优化语言模型,最大化奖励**DPO(Direct Preference Optimization)**是 2023 年后的简化替代:不需要单独训练奖励模型,直接用偏好对微调——更简单更稳定,成为开源社区主流。对齐的目标是让模型"有用、诚实、无害"(helpful, honest, harmless),这是 ChatGPT 与 base model 的分水岭。
三、上下文学习与思维链:不训练就能用
LLM 的杀手锏是推理时能力——不更新权重,只靠输入内容:
| 技巧 | 做法 | 适用 |
|---|---|---|
| 零样本提示 | 直接问("翻译成英文:你好") | 简单任务 |
| 少样本提示(few-shot) | 给几个示例再提问 | 复杂格式/风格任务 |
| 思维链(CoT) | "请一步步思考再回答" | 数学/推理任务,显著提分 |
| 自我一致性(Self-Consistency) | 多次采样 + 投票 | 高可靠推理 |
| 工具调用(Tool Use) | 模型输出结构化调用,接外部工具 | 需要实时/计算/外部数据 |
RAG(检索增强生成):LLM 不知道的事实(实时新闻、私有文档),先检索再生成:
用户提问 → 向量检索(文档库)→ 拼入上下文 → LLM 生成带引用的回答RAG 解决 LLM 的三大短板:知识过时、幻觉、无私有数据。它是企业落地 LLM 的第一选择(比微调便宜、可更新、可溯源)。详见检索增强实践。
四、微调:让模型专精
RAG 解决"知识",微调解决"风格/格式/领域行为":
| 方法 | 原理 | 成本 | 适用 |
|---|---|---|---|
| LoRA | 只训练低秩适配矩阵,冻结原权重 | 低(单卡可跑) | 大多数微调场景首选 |
| QLoRA | 4-bit 量化 + LoRA | 极低(消费级显卡) | 小团队微调 |
| 全参微调 | 所有权重都训 | 高(多卡集群) | 领域差距极大时 |
| 继续预训练 | 在领域语料上继续练 | 高 | 垂直领域(法律/医学) |
微调 vs RAG 的选择:知识类问题 → RAG;行为/格式类问题 → 微调;两者常组合(RAG 给知识 + 微调给风格)。微调最常见的误区是"用微调给模型喂知识"——那是 RAG 的活,微调学不进新事实。
五、推理与部署:让大模型跑起来
LLM 推理的工程要点(详见MLOps):
- KV Cache:缓存历史 token 的注意力键值,生成时免重算——推理速度的数倍提升;
- 批处理(Continuous Batching):多请求动态合并,GPU 利用率从个位数到 90%+;
- 量化:FP16 → INT8/INT4(AWQ、GPTQ),显存减半、吞吐翻倍;
- 投机采样(Speculative Decoding):小模型草稿 + 大模型验证,2–3 倍加速;
- 推理框架:vLLM(开源事实标准)、TensorRT-LLM、SGLang;API 服务:OpenAI/Anthropic/火山方舟/DeepSeek 等;
- 蒸馏:大模型教小模型(GPT-4 的答案蒸馏到 7B 模型),成本降 100 倍,效果保留 80%。
六、模型家族版图(2025–2026 视角)
| 类别 | 代表 | 特点 |
|---|---|---|
| 闭源旗舰 | GPT-4o/o系列、Claude、Gemini | 能力最强、API 收费、生态完善 |
| 开源追赶 | Llama、Mistral、Qwen、DeepSeek | 权重开放、可私有化部署、逼近闭源 |
| 推理模型 | o1/o3、DeepSeek-R1、Claude thinking | 思维链 + RL 强化推理,数学/代码强 |
| 多模态 | GPT-4V、Gemini、Qwen-VL、Claude | 文本+图像+音频+视频统一理解 |
| 领域小模型 | 蒸馏/微调的 1–32B 模型 | 私有部署、成本低、专注垂直场景 |
关键趋势:
- 推理模型崛起(2024 底起):训练阶段用 RL 教模型"长思考",推理能力跃升,但推理时 token 开销大("慢思考");
- 开源追平差距:DeepSeek-R1 等证明了"算法创新可以弥补算力差距",开源与闭源差距缩小到 1–2 代以内;
- 从"聊天"到"干活":LLM 作为 Agent 的大脑(工具调用、代码执行、自主任务)是 2025 年后的主战场——模型之外还需要 harness(工具、循环、权限、记忆),这正对应本站姊妹站《Agent Harness 手册》的研究对象。
七、LLM 的局限与风险
- 幻觉(hallucination):一本正经地编造事实。缓解:RAG 检索 + 引用、要求"不知道就说不知道"、评测兜底;
- 上下文窗口有限:虽然从 2K 涨到 200K+,但"长上下文 ≠ 长记忆"(中间迷失问题),超长输入仍需检索/摘要/压缩;
- 推理成本:大模型一次推理可比传统 ML 贵几个数量级——用路由(简单问题走小模型)控成本;
- 安全对齐:越狱(jailbreak)、提示注入、有害内容——需要护栏与评测(见可解释性与公平性);
- 版权与合规:训练数据与生成内容的版权争议仍在演进,商用前需合规评估。
把 LLM 当搜索引擎用是最大的误用
LLM 是"分布相似的生成器",不是"事实数据库"。知识类、实时类、可验证类需求,正确姿势是 RAG/工具调用 + 人类复核,而不是裸问模型。
八、给从业者的落地路径
想在企业用 LLM,推荐的循序渐进路径:
① 用 API + 提示工程做 PoC(验证业务价值,几天内)
② 加 RAG(接私有知识,解决事实类需求)
③ 工具调用/Agent(接系统,解决"干活"类需求)
④ LoRA 微调(定风格/格式,解决行为类需求)
⑤ 蒸馏 + 量化 + 私有部署(控成本、保数据安全)
每一步都先评估,别一步跳到最重的。团队不变量:任何 LLM 应用都要配评测集(几十个代表性问题 + 评分标准),否则"感觉变好了"无法判断。评测方法见从零搭一套模型评估。
延伸阅读
- Transformer 与 NLP——LLM 的架构基础
- 生成式模型——自回归生成机制
- 强化学习——RLHF 的 RL 基础
- MLOps 与模型部署——推理优化与监控
- 可解释性与公平性——对齐与安全
- 经典论文精读——GPT/BERT 原始论文
- 前沿进展——2025–2026 研究主线
参考资料
- Vaswani et al. Attention Is All You Need(2017)
- Brown et al. Language Models are Few-Shot Learners(GPT-3, 2020)
- Kaplan et al. Scaling Laws for Neural Language Models(2020)
- Hoffmann et al. Training Compute-Optimal LLMs(Chinchilla, 2022)
- Ouyang et al. Training language models to follow instructions with human feedback(RLHF, 2022)
- Rafailov et al. Direct Preference Optimization(DPO, 2023)
- Hu et al. LoRA: Low-Rank Adaptation of Large Language Models(ICLR 2022)
- Lewis et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks(RAG, 2020)
- Wei et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models(NeurIPS 2022)
- DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via RL(2025)