外观
大语言模型(LLM)
一句话定义:大语言模型(Large Language Model, LLM)是在海量文本上以"预测下一个 token"为目标的超大规模 Transformer 解码器,通过预训练-微调-对齐三段式,把"统计共现"升维为"通用能力"——它是Transformer 架构规模化后涌现出的新一代智能底座。
一、预训练:一句话,全世界
LLM 的预训练目标极其朴素:给定上文,预测下一个 token。把互联网级语料切成长度为 2048/8192 的 token 序列,批量喂给解码器做交叉熵。就这么简单?关键在规模与数据:
- 数据配比:真实语料混杂网页(Common Crawl)、书籍、代码(GitHub)、论文、百科。配比决定能力光谱:代码占比高的模型推理更强,教科书占比高的模型知识更干净。去重、清洗、质量过滤是预训练的前置工程,方法见数据与数据工程;
- token 化:BPE 等算法把词切成子词,平衡词表大小与序列效率——这决定了模型"看到的世界粒度";
- 规模与涌现:小模型学的是"词语搭配",当参数量跨过某一量级(数十亿~百亿),少样本学习、指令遵循、算术推理等能力"涌现"。学术界对"涌现是否只是评测口径造成的幻觉"有激烈争论——但规模效应的存在本身无可争议。
二、扩展定律:算力、参数与数据的三角
扩展定律(Scaling Laws)把"规模→能力"的经验关系量化:
- Kaplan 定律(2020,OpenAI):模型损失随参数量、数据量、算力呈幂律下降——钱花得越多,模型越好;
- Chinchilla 定律(2022,DeepMind):模型规模与数据量应等比放大,最优数据量约等于参数量×20(即 70B 参数配 1.4T token)。此前"只加大模型、不管数据"的做法被证明是次优的;
- 教训:在算力预算固定时,参数与数据的配比不是随便定的;"数据比模型更缺"是 2023 年后的共识,因此出现合成数据、数据复用等路线。
工程现实
扩展定律说的是"趋势",不是"个人清单"。实际做项目时算力预算有限,真正值得做的组合是:用小模型 + 更多数据 + 更好的数据质量,或用开源基座 + 微调/蒸馏,具体策略见 MLOps 与模型部署。
三、SFT:指令微调
预训练模型只会"续写",不懂"问答"。**监督微调(Supervised Fine-Tuning, SFT)**用(指令,回答)对把模型调成"助理":把指令拼进上文,让模型学习生成标准回答。要点:
- 数据是"配方核心":几十万条高质量指令即可大幅改善对话能力,质量远胜数量;
- 用交叉熵只算回答部分的损失(指令部分掩码掉),避免模型只学会"复读指令";
- SFT 是后续对齐(RLHF/DPO)的必经第一步,见表征学习与预训练对预训练/微调框架的一般性论述。
四、对齐:RLHF 与 DPO
SFT 让模型"会说人话",对齐让模型"说人想听的话"。**RLHF(基于人类反馈的强化学习)**分三步:
- 用人类标注偏好对(回答 A vs B 谁更好),训练一个奖励模型(RM);
- 让策略模型生成回答,奖励模型打分;
- 用 PPO 等强化学习算法最大化奖励,同时加 KL 惩罚防止偏离参考模型太远。
DPO(2023)跳过显式奖励模型,直接利用偏好对数据做分类损失优化,更简单稳定,成为开源社区的默认选择。RLHF/DPO 本质是"把人类价值偏好注入模型"——它既是深度强化学习应用里 RL 在工业界的最大落地,也带来"越对齐越保守/越谄媚"的副作用,学界争议不断。
五、上下文学习 ICL 与 few-shot
ICL(In-Context Learning)是 GPT-3(2020)发现的现象:不改权重,只在提示词里放几个示例,模型就能学会做新任务——相当于"运行时编程"。few-shot(几个示例)、zero-shot(零示例直接描述任务)由此成为 LLM 的默认用法。它让我们可以"不训练就改行为",代价是提示词工程(prompt engineering)成为一门手艺,且效果受示例顺序、格式影响大。
六、RAG:检索增强生成
LLM 的知识截止在训练数据时间点,且会幻觉。**RAG(Retrieval-Augmented Generation,2020)**把检索器接到生成器前面:
- 把文档库切成块、嵌入成向量;
- 用户提问时先检索 top-k 相关块;
- 把检索结果拼进提示词,让模型"带着资料作答"。
RAG 让模型可以访问私有数据、实时知识,可溯源、可更新,是企业落地 LLM 的主流方案(成本远低于重训)。它与微调的选型:知识型问题用 RAG,风格/行为型问题用微调。向量检索基础设施与评估方法见评估实践。
七、推理优化:KV cache、量化、投机采样
部署 LLM 的成本主要在推理。三大招:
- KV cache:解码时缓存历史 K、V 避免重算(原理见 Transformer 架构一文);显存随序列线性涨,遂有 PagedAttention(vLLM)、KV 量化、上下文压缩等方案;
- 量化:把权重从 FP16 压到 INT8/INT4(GPTQ、AWQ、GGUF),显存和延迟大幅下降,代价是精度微损——注意"量化模型 + 低算力设备"是端侧部署的前提;
- 投机采样(Speculative Decoding):用小模型先草拟一批 token,大模型一次验证,算力换延迟,无损加速 2~3 倍。
工业推理框架(vLLM、TGI、SGLang)已把这些能力产品化,见MLOps 与模型部署。
八、幻觉与评估:benchmark 批判
- 幻觉:模型"一本正经地编造"。成因包括训练目标只有"像文本"、无事实监督、知识截断。缓解靠 RAG、检索事实核查、解码约束;但根除是开放问题。
- 评估:MMLU(57 学科选择题)、HELM(斯坦福,多维度标准化评测)、HumanEval(代码)是常见榜单。榜单批判同样重要:题目会泄漏进训练集、选择题易被"刷分"、静态榜单无法反映真实任务的可靠性。真正有效的是任务导向的评估集 + 人类盲评,方法论见深度学习评估与实验。
理性看待"排行榜"
模型分数是"能力的下界证据",不是"能力的上界承诺"。同一个模型在不同领域、不同提问方式下的表现方差极大——评估设计本身就是一个研究课题,别让单一分数决定技术选型。
九、从 LLM 到 Agent
LLM 的下一个范式跃迁是让模型用工具:把思考链(CoT)、工具调用(function calling)、多步执行、记忆与环境反馈组合成"Agent 循环"——模型不再是"回答问题",而是"完成目标"。
- 工具:搜索、代码解释器、浏览器、数据库、外部 API;
- 框架:ReAct(思考-行动-观察循环)、规划器+执行器架构;
- 现实约束:Agent 的成功率受单步准确率连乘影响,幻觉会被放大;目前学界共识是"可靠性 > 聪明程度",评测与兜底设计(见评估实践)比堆功能更重要。
Agent 与多模态结合后还能操作图像/视频/真实设备,这部分与多模态模型交汇,是前沿进展的常客。
十、权衡与取舍
- 基座 vs 微调 vs RAG:数据敏感用 RAG、行为塑形用微调、通用能力靠基座,多数场景是"RAG + 轻量微调"的组合拳;
- 开源 vs 闭源:闭源省运维但数据主权/成本受制,开源(LLaMA、Qwen、DeepSeek)可控但需自行维护与对齐——权衡还牵涉合规与可解释性与公平性;
- 规模 vs 效率:更大的模型通常更聪明,但推理成本、延迟、能耗都涨。预算敏感时,蒸馏与 MoE(混合专家,如 Mixtral、DeepSeek-V3)在"能力/成本"上更划算;
- 能力 vs 对齐:过度对齐会钝化能力与多样性,欠对齐则危险——这个张力没有完美解,只有持续工程与治理。
延伸阅读
- Transformer 架构——LLM 的物理基础
- 多模态模型——LLM 的"看听说"扩展
- 深度强化学习应用——RLHF/RLVR 的 RL 视角
- 深度学习评估与实验——评测方法论的地基
- 数据与数据工程——预训练语料的幕后
- MLOps 与模型部署——推理优化与工程落地
参考资料
- Brown et al. Language Models are Few-Shot Learners (GPT-3) (NeurIPS 2020)
- Kaplan et al. Scaling Laws for Neural Language Models (2020)
- Hoffmann et al. Training Compute-Optimal Large Language Models (Chinchilla) (2022)
- Ouyang et al. Training language models to follow instructions with human feedback (InstructGPT) (NeurIPS 2022)
- Rafailov et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model (NeurIPS 2023)
- Lewis et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (NeurIPS 2020)
- Liang et al. Holistic Evaluation of Language Models (HELM) (TMLR 2023)
- Yao et al. ReAct: Synergizing Reasoning and Acting in Language Models (ICLR 2023)