GAME 02 · 训练模拟器
HANDS-ON · 动手训练

大模型训练模拟器

PRE-TRAIN · FINE-TUNE · ALIGN

你将扮演训练师,亲手把一个"胡言乱语"的基座模型,训练成流畅、安全、有用的 AI 助手。体验预训练猜词、监督微调、人类对齐 RLHF 的完整三阶段。

🧠
PARAMS
125M
📉
LOSS
QUALITY
0%
PRE-TRAINING
01
预训练
PRE-TRAINING · 猜下一个词
02
监督微调
SFT · 学会当助手
🔒
03
人类对齐
RLHF · 有用·诚实·无害
🔒

🔮 预训练 · 猜下一个 Token

大模型在预训练阶段只做一件事:预测下一个词。猜对了 loss 下降,模型逐渐学会语言规律。
// TRAINING LOSS · 训练损失曲线
训练步数 →损失越低越好(交叉熵)
// CONTEXT · 给模型看的前文(请预测下一个 token)
// 选出最可能出现的下一个 token

🎯 你的训练统计

已训练样本0 / 8
正确预测0
准确率
当前 Loss4.20

💡 知识点

预训练的目标是最大化 P(下一个词 | 前文)。模型在海量文本上反复做这道题,逐渐掌握语法、事实和常识。loss 用交叉熵衡量,越低说明预测越准。

✓ 预训练阶段完成!

基座模型已学会语言规律。但它现在只会"续写",还不会"听话"。点击上方 02 监督微调 进入下一阶段。

// TRAINING COMPLETE

🎉 模型已毕业!

YOUR LLM IS READY

你亲手完成了大模型的完整训练流程——从预测下一个词,到学会当助手,再到与人类价值观对齐。这就是 ChatGPT、GPT-4、Claude 背后的同一套方法论。

8/8
预训练准确率
5/5
微调指令
5/5
对齐偏好