SECTOR 01 / KNOWLEDGE EXPEDITION

大模型基础原理

深入理解大语言模型的核心概念、发展历程、基础工作原理及其背后的数学与工程原理

01

什么是大语言模型(LLM)?

EXPLORE +

定义与本质

大语言模型(Large Language Model, LLM)是一种基于深度学习的神经网络模型,通过在海量文本数据上进行自监督学习,掌握人类语言的统计规律、语法结构和语义关系。其核心思想是:给定上文,预测下文——即自回归语言建模(Autoregressive Language Modeling, ARLM)。

自回归生成原理

LLM 的核心数学框架是条件概率链式法则(Chain Rule):

P(token_1, token_2, ..., token_n) = P(token_1) × P(token_2|token_1) × P(token_3|token_1,token_2) × ... × P(token_n|token_1,...,token_{n-1})

# 训练目标:最大化给定所有前文条件下,下一个 token 的概率
Loss = -Σᵢ log P(token_i | token_<i)

# 推理生成(逐个 token 采样):
for step in range(max_tokens):
next_token = model(sampled_tokens) # 预测下一个 token 的分布
sampled = sample(next_token) # 从概率分布中采样
if sampled == EOS_TOKEN: # 遇到结束符停止
break
output.append(sampled)

这个过程就像完成一句话接龙:看到「今天天气」→ 预测「真」→ 看到「今天天气真」→ 预测「好」→ 看到「今天天气真好」→ 预测「!」,直到模型认为句子已经完整。

核心特征详解

  • 参数规模巨大:不同模型的参数规模差异很大。GPT-3 最大版本公开为 1750 亿参数;GPT-4 技术报告未公开模型规模,不能把网络估算当作已披露事实。Claude 3.5 的具体参数量也不在本课程已核实的公开资料中,因此不标注估计数字。参数量只是模型能力的影响因素之一;以假设的 1000 亿参数模型为例,若每个参数用 2 字节存储,仅权重约需 200 GB,不含推理缓存和其他开销。
  • 训练数据海量:通常在数 TB 到数百 TB 的文本上训练,涵盖网页(CommonCrawl, 包含 50 亿+ 网页)、书籍、学术论文、代码(GitHub 公开仓库)、社交媒体等多元数据源。GPT-4 技术报告未披露足以核实训练 token 总量的细节,本课程不采用网络估算值。
  • 涌现能力(Emergent Abilities):当模型规模跨越某个阈值后,突然展现出未在训练中明确优化的能力——如思维链推理、上下文学习、代码生成等。这不是逐步提升,而是相变式跃迁。例如,模型在 100 亿参数时无法解决简单算术,到 1000 亿参数时突然能准确计算三位数乘法。
  • 通用性:单一模型无需微调即可处理翻译、摘要、编程、推理、创意写作等多种任务,这是与以往专用小模型的本质区别。

主流模型架构对比

虽然统称为 LLM,但不同模型采用不同的架构设计,理解这些差异对选择合适的模型至关重要:

架构类型代表模型核心特点适用场景
Encoder-Only(编码器)BERT, RoBERTa, DeBERTa双向注意力,能同时看到上下文文本分类、实体识别、语义相似度、阅读理解(无需生成的任务)
Decoder-Only(解码器)GPT 系列, Claude, LLaMA, Qwen单向注意力(因果掩码),逐 token 生成文本生成、对话、代码生成、创作(当前最主流的架构)
Encoder-Decoder(编解码)T5, BART, GLM编码器处理输入 + 解码器生成输出翻译、摘要、文本转换(输入和输出差异大的任务)

当前趋势:GPT 系列引领的 Decoder-Only 架构已成为主流,原因在于:(1) 训练效率更高(只需要语言建模目标)(2) 推理更简单(不需要编码器解码器之间的交叉注意力)(3) 扩展性更好(Scaling Laws 在 Decoder-Only 上已验证得最充分)。

重点:LLM 是如何训练的?

训练一个大语言模型分为两个关键阶段:

  1. 预训练(Pre-training):在海量无标注数据上进行自监督学习。模型“阅读”数万亿词的文本,学习语法、知识、推理模式和世界常识。训练方式就是从互联网文本中随机遮掉或预测下一个词。这个阶段需要数千甚至数万张 GPU/TPU 并行计算数周到数月。
  2. 对齐训练(Alignment):通过 RLHF 等技术让模型的输出符合人类偏好。预训练模型只是“预测下一个词”的高手,但不一定知道如何“有用且安全地回答”。对齐训练让模型学会说“我不知道”、拒绝不当请求、提供简洁有帮助的回答。

技术演进时间线

年份里程碑核心贡献
2017Transformer 论文Google 提出「Attention Is All You Need」,用自注意力替代 RNN,奠定现代 LLM 架构基础
2018.06GPT-1OpenAI 证明生成式预训练 + 微调范式的有效性,1.17 亿参数
2018.10BERTGoogle 引入双向编码器预训练(Masked LM),刷新 11 项 NLP 任务记录,3.4 亿参数
2019.02GPT-215 亿参数,展示 zero-shot 迁移能力,引发对 AI 安全的讨论
2020.05GPT-31750 亿参数,Few-shot 能力爆发,API 商业化开启,标志着 Scaling 时代的到来
2021.07CodexGPT-3 的代码微调版,驱动 GitHub Copilot,证明代码训练能增强推理能力
2022.03InstructGPT 论文研究使用人类反馈改善语言模型遵循指令的能力
2022.11.30ChatGPT 公开上线OpenAI 发布对话式产品的研究预览;与 InstructGPT 论文分列为不同事件
2022.03ChinchillaDeepMind 揭示最优计算分配法则:模型参数和训练数据应等比例扩展
2023.02LLaMAMeta 开源高质量模型,证明小模型+更多数据也能超越大模型,推动开源生态爆发
2023.03GPT-4多模态能力、长上下文(32K→128K)、推理水平飞跃,在各种专业考试中名列前茅
2024-25Claude 4 / GPT-5深度推理、Agent 能力、超长上下文(1M+),模型自主性大幅提升,推理过程可解释

资料:GPT-4 技术报告,第 2 节OpenAI:Introducing ChatGPT

02

LLM 的核心能力与局限性

EXPLORE +

基础能力矩阵

  • 文本生成:基于概率分布的自回归生成,每个 token 的预测都依赖于前面的全部上下文。
  • 语言理解:通过注意力机制捕获长距离依赖关系,理解文本的语义、情感、意图甚至言外之意。
  • 上下文学习(In-Context Learning):模型可依据提示词中的任务示例调整当前回答,无需在推理时更新模型参数。有研究用注意力与梯度下降的数学联系解释这种现象,并给出实验支持;这是对机制的一种研究解释,不能视为所有模型、任务中的定论。
  • 代码生成与推理:不仅能写代码,还能理解算法逻辑、分析复杂度、调试错误。

高级能力

  • 思维链推理(Chain-of-Thought):通过展示中间推理步骤,显著提升数学、逻辑等复杂任务的准确率,在某些基准测试上提升 30-50%。
  • 工具使用:通过函数调用(Function Calling)机制调用外部 API、执行代码、搜索网络,大幅扩展能力边界。
  • 规划与分解:将复杂任务递归拆解为子任务,并协调执行顺序。
  • 多轮记忆:在长对话中维持上下文一致性,Claude 4 等模型能在 200K+ 上下文中准确回忆早期细节。

核心局限性

  • 幻觉(Hallucination):模型可能生成看似合理但事实错误的内容。原因是 LLM 本质是下一个 token 预测器,并非事实数据库。缓解方案包括 RAG、提示词约束、对抗性采样等。
  • 知识截止:模型知识源于训练数据,无法自动获取新信息。
  • 上下文窗口限制:虽然窗口已扩展到百万级,但长上下文中的「迷失在中间」(Lost in the Middle)现象仍然存在——模型对输入中间部分的关注度低于开头和结尾。
  • 推理不一致:模型可能在简单算术上犯错,对问题的措辞变化敏感,难以进行真正的因果推理。

资料:Dai 等:Why Can GPT Learn In-Context?(2023)。论文摘要明确指出 ICL 的工作机制仍是开放问题。

03

Token 与 Tokenization 算法(BPE)

EXPLORE +

Token 的本质

Token 是分词器处理文本时划分的文本片段,再映射为模型使用的 token ID。它可能对应一个词、词的一部分、标点、空白或字节片段,不保证具有独立语义,也不总与一个汉字或单词对应。

为什么需要 Tokenization?

分词器把文本转成模型可处理的整数序列。不同分词算法和词表在序列长度、词表大小与未见文本的表示能力之间取舍;分词本身并不消除模型上下文长度限制。

BPE(Byte Pair Encoding)算法详解

BPE 是常见的子词分词算法。字符级与字节级实现的基础单元不同,实际模型采用的分词器应以其公开实现为准。以下是教学简化示例:

# BPE 训练阶段
1. 把训练文本表示为基础单元序列(字符或字节,取决于实现)
字符级示例:hello → [h, e, l, l, o]

2. 统计当前序列中相邻 token 对的频率

3. 合并当前频率最高的一对,并记录合并规则
若 (l, l) 最频繁,则变为 [h, e, ll, o]

4. 重复统计与合并,直到达到词表大小或其他停止条件

# 编码新文本
使用已学得的词表和合并规则,按规则优先级执行适用的合并。

Token 数量估算

文本计数要点
英文一个词可能对应一个或多个 token;常见估算不能替代实际分词结果
中文一个汉字或词可能被合并或拆分,数量依赖具体词表和文本
代码标识符、缩进、标点与空白都会影响 token 数量

需要精确计数时,应使用目标模型对应的分词器,不套用跨模型、跨语言的固定换算比例。

资料:Hugging Face Transformers:Summary of the tokenizersOpenAI:tiktoken

04

预训练与微调

EXPLORE +

预训练(Pre-training)—— 构建基础能力

预训练是在海量无标注数据上训练模型的核心阶段:

# 预训练目标函数(自回归语言建模)
Loss = -Σ log P(token_i | token_1, ..., token_{i-1})
# 即:最大化给定上文条件下,下一个 token 的概率
  • 训练数据:CommonCrawl(数万亿 token)、书籍、论文、代码、维基百科等
  • 计算量:GPT-3 用了数千个 GPU 训练数月,总计算量约 3.14×10³ FLOPS
  • 成本:GPT-4 级别模型训练成本数亿美元
  • 硬件:数万个 GPU 并行训练,需要 3D 并行(数据并行+张量并行+流水线并行)

微调(Fine-tuning)—— 任务适配

  • SFT(监督微调):使用人工标注的高质量对话数据训练
  • RLHF(人类反馈强化学习):RLHF 三阶段:1) 收集人类偏好数据 2) 训练奖励模型 RM 3) 用 PPO 算法优化语言模型
  • DPO(直接偏好优化):2023 年提出的简化方案,不需要独立的奖励模型

提示词 vs 微调:决策框架

维度提示词工程微调
实施门槛低,只需编写文本高,需要 ML 工程能力
成本零成本高(标注数据 + GPU 算力)
迭代速度即时调整数小时到数天
推荐场景初步验证、快速原型生产级定制、私有知识
05

缩放定律(Scaling Laws)

EXPLORE +

核心发现

2020 年 OpenAI 发表的 Scaling Laws 揭示了一个关键规律:模型的性能与模型参数量 N、数据量 D、计算量 C 之间存在可预测的幂律关系。

# 缩放定律的核心公式(幂律关系)
Loss(N) ≈ a/N^α + c (损失随参数量增大而下降)
Loss(D) ≈ b/D^β + c (损失随数据量增大而下降)
# 其中 α ≈ 0.076, β ≈ 0.095

Chinchilla 最优计算分配

DeepMind 2022 年的 Chinchilla 论文:对于给定的计算预算,模型参数量和训练 token 数应该等比例扩展

# Chinchilla 最优分配法则
Total_Compute ≈ 6 × N × D
# N = 参数量,D = 训练 token 数

涌现能力

  • GPT-2(1.5B):基本文本生成
  • GPT-3(175B):Few-shot 学习能力爆发
  • PaLM(540B):思维链推理能力凸显
  • GPT-4(参数量未公开):多模态理解、复杂推理
06

RLHF 与人类对齐

EXPLORE +

为什么需要对齐?

预训练模型的目标是「预测下一个 token」,而非「输出有用且安全的回答」。对齐(Alignment)的目标是让模型行为符合人类价值观和期望。

RLHF 三阶段详解

阶段一:监督微调(SFT)
收集人工编写的示范数据(问题+理想回答)
在预训练模型上做标准的监督学习

阶段二:训练奖励模型(Reward Model)
收集对比数据:对同一问题,让模型生成多个回答
人工排序(A > B > C > D)
训练一个分类模型预测人类偏好
RM 损失:Loss = -log(σ(r_θ(x, y_w) - r_θ(x, y_l)))

阶段三:PPO 强化学习
使用 RM 作为奖励信号,优化语言模型
PPO 目标包含:策略梯度 + KL 散度惩罚 + 价值函数损失

DPO:更简洁的替代方案

DPO 避免了训练 RM 和 PPO 的复杂性,直接优化偏好:

L_DPO = -E[log σ(β * log(π_θ(y_w|x)/π_ref(y_w|x))
- β * log(π_θ(y_l|x)/π_ref(y_l|x)))]

对齐的挑战

  • 奖励欺骗(Reward Hacking):模型找到最大化奖励但不符合人类意图的方式
  • 能力衰退:过度对齐可能导致模型在通用任务上性能下降
  • 价值观冲突:不同文化对「好回答」的定义不一致