AI 教学 · 第一章 · 导论

大模型

LARGE LANGUAGE MODEL

从感知机到 GPT,从 TransformerAgent
这是一场改变世界的智能革命

SCROLL · 滚动探索
CHAPTER // 01
EVOLUTION · 发展历史

一场七十年的远征

从单个神经元到万亿参数,大模型并非一夜爆发,而是无数研究者数十年的积累。横向滚动,见证关键里程碑。

🔵
1958
THE BEGINNING

感知机 Perceptron

Rosenblatt 提出首个可学习的神经网络模型,奠定"连接主义"基础。它能识别简单图形,却也埋下了日后被质疑的种子。

神经网络起源连接主义
🔁
1986
BACKPROPAGATION

反向传播算法

Rumelhart、Hinton 与 Williams 推广反向传播(Backpropagation),让多层神经网络可以高效训练,深度学习有了引擎。

梯度下降多层训练
🧠
1997
MEMORY GATE

LSTM 长短期记忆

Hochreiter 提出 LSTM,用门控机制攻克 RNN 的长程依赖难题,使序列建模真正可用,统治序列任务近二十年。

门控机制序列建模
🌊
2006
DEEP LEARNING

深度学习元年

Hinton 提出深度信念网络与逐层预训练,"Deep Learning" 一词正式登场,沉寂的神经网络迎来复兴。

逐层预训练深度复兴
📐
2013
EMBEDDING

Word2Vec 词向量

Mikolov 提出 Word2Vec,用分布式向量表示词义,让"国王 − 男人 + 女人 = 女王"成为可能,开启 embedding 时代。

分布式表示语义空间
🔗
2014
SEQ2SEQ + ATTN

序列到序列 & 注意力

Sutskever 提出 Seq2Seq,Bahdanau 引入注意力机制,让模型学会"该看哪里",机器翻译质量实现飞跃。

编码-解码注意力萌芽
📚
2018
PRE-TRAIN ERA

预训练革命

Google BERT 与 OpenAI GPT-1 同年诞生,"预训练 + 微调"范式确立,NLP 进入大一统时代。

BERTGPT-1预训练范式
2020
EMERGENCE

GPT-3 涌现

1750 亿参数,首次展现惊人的"涌现能力"与少样本学习——无需微调,仅靠几个示例就能完成新任务。

175B 参数涌现能力In-Context
🌐
2023
MULTI-MODAL

百模齐发

GPT-4 支持图文多模态,Meta 开源 LLaMA 引发开源浪潮,Claude、Gemini、文心一言竞逐登场。

GPT-4LLaMA多模态
🎬
2024
REASONING & GEN

推理与生成

OpenAI o1/o3 开启"推理模型"时代,会思考、会反思;Sora 实现文本到视频生成,物理世界模拟初现。

o1 推理Sora 视频慢思考
← 横向滚动 / SWIPE → → →
13 个里程碑
CHAPTER // 02
DEFINITION · 定义与核心特征

什么是大模型

// DEFINITION
大模型(LLM)是基于 Transformer 架构、在海量文本上自监督预训练、参数规模达 数十亿至万亿 的通用语言模型。
它不针对单一任务设计,而是通过"预测下一个词"这一简单目标,习得语言、知识与推理的通用能力,并能适配翻译、写作、编程、问答等几乎所有 NLP 任务。
📈 SCALING LAW · 性能随规模幂律提升

涌现能力EMERGENT ABILITIES

参数规模突破临界点后,模型突然"解锁"小模型完全没有的能力——算术、翻译、推理,量变引发质变。

📐

Scaling Law规模法则

性能随参数量、数据量、算力呈可预测的幂律提升。这是"大力出奇迹"的理论依据,也是 scaling 的信仰之源。

🎯

上下文学习IN-CONTEXT LEARNING

无需更新参数,只在 prompt 中给几个示例,模型就能学会新任务。这是大模型最神奇的能力之一。

🧩

思维链CHAIN-OF-THOUGHT

引导模型"一步一步思考",复杂推理能力显著提升。这是激发大模型推理能力的关键提示工程技巧。

CHAPTER // 03
TRAINING PIPELINE · 训练流程

三步炼成大模型

一个大模型从"胡言乱语"到"善解人意",需要经历三个阶段:预训练 → 监督微调 → 人类对齐。横向滚动,逐一拆解。

01
STAGE 01 · PRE-TRAINING

预训练

PRE-TRAINING

在数万亿 token 的互联网文本上,做一件最简单的事:预测下一个词

  • 数据:网页、书籍、代码、论文等海量无标注文本(万亿级 token)
  • 目标:自回归语言建模,最大化 P(下一个词 | 前文)
  • 成本:数千张 GPU,训练数月,耗资数百万至千万美元
  • 产物:"基座模型"——知识渊博,但不会"听话"
🎯 目标:next token prediction · 学会语言与世界知识
02
STAGE 02 · SFT

监督微调

SUPERVISED FINE-TUNING

用高质量的"指令-回答"对,教会模型听懂并遵循人类指令

  • 数据:人工编写的高质量指令数据(数万至数十万条)
  • 目标:学会"问什么答什么",从续写转为对话
  • 变化:模型从"续写器"变成"助手",懂得按指令格式输出
  • 产物:"指令模型"——会聊天,但风格未必讨喜
🎯 目标:instruction following · 学会当助手
03
STAGE 03 · ALIGNMENT

人类对齐

RLHF / DPO · HUMAN ALIGNMENT

用人类偏好反馈训练奖励模型,再通过强化学习让回答更有用、更诚实、更安全

  • RLHF:训练奖励模型 → PPO 优化策略,ChatGPT 的核心
  • DPO:直接偏好优化,跳过奖励模型,更简单稳定
  • 准则:Helpful(有用)、Honest(诚实)、Harmless(无害)
  • 产物:最终的"对话大模型"——流畅、安全、可控
🎯 目标:align with human values · 学会做个好助手
← 横向滚动查看三阶段 → → →
预训练 → SFT → 对齐
// READY TO DIVE IN

准备好开启
AI 之旅了吗?

YOUR JOURNEY INTO AI STARTS HERE

你已经了解了大模型的历史、定义与训练流程。接下来,让我们走进 AI 教学应用,亲手探索、动手实践,真正掌握这门改变世界的技术。

CHAPTER 01 · INTRODUCTION COMPLETE · 点击按钮进入学习应用