什么是大语言模型(LLM)?
EXPLORE +
定义与本质
大语言模型(Large Language Model, LLM)是一种基于深度学习的神经网络模型,通过在海量文本数据上进行自监督学习,掌握人类语言的统计规律、语法结构和语义关系。其核心思想是:给定上文,预测下文——即自回归语言建模(Autoregressive Language Modeling, ARLM)。
自回归生成原理
LLM 的核心数学框架是条件概率链式法则(Chain Rule):
P(token_1, token_2, ..., token_n) = P(token_1) × P(token_2|token_1) × P(token_3|token_1,token_2) × ... × P(token_n|token_1,...,token_{n-1})
# 训练目标:最大化给定所有前文条件下,下一个 token 的概率
Loss = -Σᵢ log P(token_i | token_<i)
# 推理生成(逐个 token 采样):
for step in range(max_tokens):
next_token = model(sampled_tokens) # 预测下一个 token 的分布
sampled = sample(next_token) # 从概率分布中采样
if sampled == EOS_TOKEN: # 遇到结束符停止
break
output.append(sampled)这个过程就像完成一句话接龙:看到「今天天气」→ 预测「真」→ 看到「今天天气真」→ 预测「好」→ 看到「今天天气真好」→ 预测「!」,直到模型认为句子已经完整。
核心特征详解
- 参数规模巨大:不同模型的参数规模差异很大。GPT-3 最大版本公开为 1750 亿参数;GPT-4 技术报告未公开模型规模,不能把网络估算当作已披露事实。Claude 3.5 的具体参数量也不在本课程已核实的公开资料中,因此不标注估计数字。参数量只是模型能力的影响因素之一;以假设的 1000 亿参数模型为例,若每个参数用 2 字节存储,仅权重约需 200 GB,不含推理缓存和其他开销。
- 训练数据海量:通常在数 TB 到数百 TB 的文本上训练,涵盖网页(CommonCrawl, 包含 50 亿+ 网页)、书籍、学术论文、代码(GitHub 公开仓库)、社交媒体等多元数据源。GPT-4 技术报告未披露足以核实训练 token 总量的细节,本课程不采用网络估算值。
- 涌现能力(Emergent Abilities):当模型规模跨越某个阈值后,突然展现出未在训练中明确优化的能力——如思维链推理、上下文学习、代码生成等。这不是逐步提升,而是相变式跃迁。例如,模型在 100 亿参数时无法解决简单算术,到 1000 亿参数时突然能准确计算三位数乘法。
- 通用性:单一模型无需微调即可处理翻译、摘要、编程、推理、创意写作等多种任务,这是与以往专用小模型的本质区别。
主流模型架构对比
虽然统称为 LLM,但不同模型采用不同的架构设计,理解这些差异对选择合适的模型至关重要:
| 架构类型 | 代表模型 | 核心特点 | 适用场景 |
|---|---|---|---|
| Encoder-Only(编码器) | BERT, RoBERTa, DeBERTa | 双向注意力,能同时看到上下文 | 文本分类、实体识别、语义相似度、阅读理解(无需生成的任务) |
| Decoder-Only(解码器) | GPT 系列, Claude, LLaMA, Qwen | 单向注意力(因果掩码),逐 token 生成 | 文本生成、对话、代码生成、创作(当前最主流的架构) |
| Encoder-Decoder(编解码) | T5, BART, GLM | 编码器处理输入 + 解码器生成输出 | 翻译、摘要、文本转换(输入和输出差异大的任务) |
当前趋势:GPT 系列引领的 Decoder-Only 架构已成为主流,原因在于:(1) 训练效率更高(只需要语言建模目标)(2) 推理更简单(不需要编码器解码器之间的交叉注意力)(3) 扩展性更好(Scaling Laws 在 Decoder-Only 上已验证得最充分)。
重点:LLM 是如何训练的?
训练一个大语言模型分为两个关键阶段:
- 预训练(Pre-training):在海量无标注数据上进行自监督学习。模型“阅读”数万亿词的文本,学习语法、知识、推理模式和世界常识。训练方式就是从互联网文本中随机遮掉或预测下一个词。这个阶段需要数千甚至数万张 GPU/TPU 并行计算数周到数月。
- 对齐训练(Alignment):通过 RLHF 等技术让模型的输出符合人类偏好。预训练模型只是“预测下一个词”的高手,但不一定知道如何“有用且安全地回答”。对齐训练让模型学会说“我不知道”、拒绝不当请求、提供简洁有帮助的回答。
技术演进时间线
| 年份 | 里程碑 | 核心贡献 |
|---|---|---|
| 2017 | Transformer 论文 | Google 提出「Attention Is All You Need」,用自注意力替代 RNN,奠定现代 LLM 架构基础 |
| 2018.06 | GPT-1 | OpenAI 证明生成式预训练 + 微调范式的有效性,1.17 亿参数 |
| 2018.10 | BERT | Google 引入双向编码器预训练(Masked LM),刷新 11 项 NLP 任务记录,3.4 亿参数 |
| 2019.02 | GPT-2 | 15 亿参数,展示 zero-shot 迁移能力,引发对 AI 安全的讨论 |
| 2020.05 | GPT-3 | 1750 亿参数,Few-shot 能力爆发,API 商业化开启,标志着 Scaling 时代的到来 |
| 2021.07 | Codex | GPT-3 的代码微调版,驱动 GitHub Copilot,证明代码训练能增强推理能力 |
| 2022.03 | InstructGPT 论文 | 研究使用人类反馈改善语言模型遵循指令的能力 |
| 2022.11.30 | ChatGPT 公开上线 | OpenAI 发布对话式产品的研究预览;与 InstructGPT 论文分列为不同事件 |
| 2022.03 | Chinchilla | DeepMind 揭示最优计算分配法则:模型参数和训练数据应等比例扩展 |
| 2023.02 | LLaMA | Meta 开源高质量模型,证明小模型+更多数据也能超越大模型,推动开源生态爆发 |
| 2023.03 | GPT-4 | 多模态能力、长上下文(32K→128K)、推理水平飞跃,在各种专业考试中名列前茅 |
| 2024-25 | Claude 4 / GPT-5 | 深度推理、Agent 能力、超长上下文(1M+),模型自主性大幅提升,推理过程可解释 |