从感知机到 GPT,从 Transformer 到 Agent
这是一场改变世界的智能革命
从单个神经元到万亿参数,大模型并非一夜爆发,而是无数研究者数十年的积累。横向滚动,见证关键里程碑。
Rosenblatt 提出首个可学习的神经网络模型,奠定"连接主义"基础。它能识别简单图形,却也埋下了日后被质疑的种子。
Rumelhart、Hinton 与 Williams 推广反向传播(Backpropagation),让多层神经网络可以高效训练,深度学习有了引擎。
Hochreiter 提出 LSTM,用门控机制攻克 RNN 的长程依赖难题,使序列建模真正可用,统治序列任务近二十年。
Hinton 提出深度信念网络与逐层预训练,"Deep Learning" 一词正式登场,沉寂的神经网络迎来复兴。
Mikolov 提出 Word2Vec,用分布式向量表示词义,让"国王 − 男人 + 女人 = 女王"成为可能,开启 embedding 时代。
Sutskever 提出 Seq2Seq,Bahdanau 引入注意力机制,让模型学会"该看哪里",机器翻译质量实现飞跃。
Google 发表《Attention Is All You Need》,提出完全基于注意力的架构——并行、可扩展、长程建模,这就是大模型一切的起点。
Google BERT 与 OpenAI GPT-1 同年诞生,"预训练 + 微调"范式确立,NLP 进入大一统时代。
1750 亿参数,首次展现惊人的"涌现能力"与少样本学习——无需微调,仅靠几个示例就能完成新任务。
RLHF 让对话流畅自然,发布 5 天用户破百万,2 个月破亿。AI 第一次真正走进大众,世界从此不同。
GPT-4 支持图文多模态,Meta 开源 LLaMA 引发开源浪潮,Claude、Gemini、文心一言竞逐登场。
OpenAI o1/o3 开启"推理模型"时代,会思考、会反思;Sora 实现文本到视频生成,物理世界模拟初现。
从"对话"走向"行动"——Agent 自主规划、调用工具、完成复杂任务。人类正稳步迈向通用人工智能的彼岸。
参数规模突破临界点后,模型突然"解锁"小模型完全没有的能力——算术、翻译、推理,量变引发质变。
性能随参数量、数据量、算力呈可预测的幂律提升。这是"大力出奇迹"的理论依据,也是 scaling 的信仰之源。
无需更新参数,只在 prompt 中给几个示例,模型就能学会新任务。这是大模型最神奇的能力之一。
引导模型"一步一步思考",复杂推理能力显著提升。这是激发大模型推理能力的关键提示工程技巧。
一个大模型从"胡言乱语"到"善解人意",需要经历三个阶段:预训练 → 监督微调 → 人类对齐。横向滚动,逐一拆解。
在数万亿 token 的互联网文本上,做一件最简单的事:预测下一个词。
用高质量的"指令-回答"对,教会模型听懂并遵循人类指令。
用人类偏好反馈训练奖励模型,再通过强化学习让回答更有用、更诚实、更安全。
你已经了解了大模型的历史、定义与训练流程。接下来,让我们走进 AI 教学应用,亲手探索、动手实践,真正掌握这门改变世界的技术。