你将扮演训练师,亲手把一个"胡言乱语"的基座模型,训练成流畅、安全、有用的 AI 助手。体验预训练猜词、监督微调、人类对齐 RLHF 的完整三阶段。
预训练的目标是最大化 P(下一个词 | 前文)。模型在海量文本上反复做这道题,逐渐掌握语法、事实和常识。loss 用交叉熵衡量,越低说明预测越准。
基座模型已学会语言规律。但它现在只会"续写",还不会"听话"。点击上方 02 监督微调 进入下一阶段。
你亲手完成了大模型的完整训练流程——从预测下一个词,到学会当助手,再到与人类价值观对齐。这就是 ChatGPT、GPT-4、Claude 背后的同一套方法论。