Skip to content

大语言模型(LLM)

本页速览 大语言模型是深度学习与规模法则的集大成者。本文拆解 LLM 的技术全景:预训练与规模法则、指令微调与 RLHF、上下文学习与思维链、RAG 与微调、推理部署,以及 2025–2026 年的前沿走向。

大语言模型(LLM) ​

概念定义:预测下一个词的规模奇迹 ​

大语言模型(Large Language Model, LLM)是基于 Transformer 解码器、在超大规模语料上预训练的生成式模型(架构见Transformer 与 NLP)。训练目标朴素得惊人——预测下一个 token:

输入: "中国的首都是"  →  模型输出: "北京"(下一个 token 的概率分布)

但"预测下一个词"在规模加持下涌现出翻译、摘要、推理、编程、对话能力——这就是规模法则(Scaling Laws):模型能力随参数、数据、算力按幂律增长,且很多能力在某个规模阈值后突然涌现(emergence)。2020 年 GPT-3(1750 亿参数)证明了这条路,2022 年 ChatGPT 把它变成了产品。

二、LLM 是怎么炼成的:三段式 ​

阶段一:预训练(Pretraining) ​

在数万亿 token 的互联网语料(网页、书籍、代码、论文)上做"下一个词预测"。

  • 成本:数十亿~数亿美元 GPU 算力(GPT-4 级别),只有少数大厂玩得起;
  • 数据:质量 > 数量(2024 年后"数据诅咒"——低质数据太多会拖累模型,见数据工程);
  • 产物:基础模型(base model)——"会说话但不好用":能续写,但不会遵循指令、可能输出有害内容。

阶段二:指令微调(SFT) ​

用"指令-回答"对(人工编写或蒸馏)微调,让模型学会遵循指令:

用户: "用一句话解释什么是机器学习"
助手: "机器学习是让计算机从数据中自动学习规律的技术……"

阶段三:对齐(RLHF / DPO) ​

让模型输出的价值观与人类偏好一致。**RLHF(基于人类反馈的强化学习)**三步走:

① 收集人类对多个回答的偏好排序
② 训练奖励模型(reward model):学会"哪个回答更好"
③ 用 PPO 强化学习优化语言模型,最大化奖励

**DPO(Direct Preference Optimization)**是 2023 年后的简化替代:不需要单独训练奖励模型,直接用偏好对微调——更简单更稳定,成为开源社区主流。对齐的目标是让模型"有用、诚实、无害"(helpful, honest, harmless),这是 ChatGPT 与 base model 的分水岭。

三、上下文学习与思维链:不训练就能用 ​

LLM 的杀手锏是推理时能力——不更新权重,只靠输入内容:

技巧做法适用
零样本提示直接问("翻译成英文:你好")简单任务
少样本提示(few-shot)给几个示例再提问复杂格式/风格任务
思维链(CoT)"请一步步思考再回答"数学/推理任务,显著提分
自我一致性(Self-Consistency)多次采样 + 投票高可靠推理
工具调用(Tool Use)模型输出结构化调用,接外部工具需要实时/计算/外部数据

RAG(检索增强生成):LLM 不知道的事实(实时新闻、私有文档),先检索再生成:

用户提问 → 向量检索(文档库)→ 拼入上下文 → LLM 生成带引用的回答

RAG 解决 LLM 的三大短板:知识过时、幻觉、无私有数据。它是企业落地 LLM 的第一选择(比微调便宜、可更新、可溯源)。详见检索增强实践。

四、微调:让模型专精 ​

RAG 解决"知识",微调解决"风格/格式/领域行为":

方法原理成本适用
LoRA只训练低秩适配矩阵,冻结原权重低(单卡可跑)大多数微调场景首选
QLoRA4-bit 量化 + LoRA极低(消费级显卡)小团队微调
全参微调所有权重都训高(多卡集群)领域差距极大时
继续预训练在领域语料上继续练高垂直领域(法律/医学)

微调 vs RAG 的选择:知识类问题 → RAG;行为/格式类问题 → 微调;两者常组合(RAG 给知识 + 微调给风格)。微调最常见的误区是"用微调给模型喂知识"——那是 RAG 的活,微调学不进新事实。

五、推理与部署:让大模型跑起来 ​

LLM 推理的工程要点(详见MLOps):

  • KV Cache:缓存历史 token 的注意力键值,生成时免重算——推理速度的数倍提升;
  • 批处理(Continuous Batching):多请求动态合并,GPU 利用率从个位数到 90%+;
  • 量化:FP16 → INT8/INT4(AWQ、GPTQ),显存减半、吞吐翻倍;
  • 投机采样(Speculative Decoding):小模型草稿 + 大模型验证,2–3 倍加速;
  • 推理框架:vLLM(开源事实标准)、TensorRT-LLM、SGLang;API 服务:OpenAI/Anthropic/火山方舟/DeepSeek 等;
  • 蒸馏:大模型教小模型(GPT-4 的答案蒸馏到 7B 模型),成本降 100 倍,效果保留 80%。

六、模型家族版图(2025–2026 视角) ​

类别代表特点
闭源旗舰GPT-4o/o系列、Claude、Gemini能力最强、API 收费、生态完善
开源追赶Llama、Mistral、Qwen、DeepSeek权重开放、可私有化部署、逼近闭源
推理模型o1/o3、DeepSeek-R1、Claude thinking思维链 + RL 强化推理,数学/代码强
多模态GPT-4V、Gemini、Qwen-VL、Claude文本+图像+音频+视频统一理解
领域小模型蒸馏/微调的 1–32B 模型私有部署、成本低、专注垂直场景

关键趋势:

  1. 推理模型崛起(2024 底起):训练阶段用 RL 教模型"长思考",推理能力跃升,但推理时 token 开销大("慢思考");
  2. 开源追平差距:DeepSeek-R1 等证明了"算法创新可以弥补算力差距",开源与闭源差距缩小到 1–2 代以内;
  3. 从"聊天"到"干活":LLM 作为 Agent 的大脑(工具调用、代码执行、自主任务)是 2025 年后的主战场——模型之外还需要 harness(工具、循环、权限、记忆),这正对应本站姊妹站《Agent Harness 手册》的研究对象。

七、LLM 的局限与风险 ​

  • 幻觉(hallucination):一本正经地编造事实。缓解:RAG 检索 + 引用、要求"不知道就说不知道"、评测兜底;
  • 上下文窗口有限:虽然从 2K 涨到 200K+,但"长上下文 ≠ 长记忆"(中间迷失问题),超长输入仍需检索/摘要/压缩;
  • 推理成本:大模型一次推理可比传统 ML 贵几个数量级——用路由(简单问题走小模型)控成本;
  • 安全对齐:越狱(jailbreak)、提示注入、有害内容——需要护栏与评测(见可解释性与公平性);
  • 版权与合规:训练数据与生成内容的版权争议仍在演进,商用前需合规评估。

把 LLM 当搜索引擎用是最大的误用

LLM 是"分布相似的生成器",不是"事实数据库"。知识类、实时类、可验证类需求,正确姿势是 RAG/工具调用 + 人类复核,而不是裸问模型。

八、给从业者的落地路径 ​

想在企业用 LLM,推荐的循序渐进路径:

① 用 API + 提示工程做 PoC(验证业务价值,几天内)
② 加 RAG(接私有知识,解决事实类需求)
③ 工具调用/Agent(接系统,解决"干活"类需求)
④ LoRA 微调(定风格/格式,解决行为类需求)
⑤ 蒸馏 + 量化 + 私有部署(控成本、保数据安全)
每一步都先评估,别一步跳到最重的。

团队不变量:任何 LLM 应用都要配评测集(几十个代表性问题 + 评分标准),否则"感觉变好了"无法判断。评测方法见从零搭一套模型评估。

延伸阅读 ​

参考资料 ​