数据截至 (上游 commit 92d63d4e8bb4)
03 · 后训练链:SFT 与 RL
这一章讲什么: base 模型怎么变成 chat 模型。两步:SFT(
scripts/chat_sft.py)教它对话格式与能力,RL(scripts/chat_rl.py)在数学题上按「答对奖励」再推一把。
1. 它要解决的小问题
预训练只教会模型「续写文本」。要变成 ChatGPT 还缺三样:
- 格式:听懂
<|user_start|>之后的提问,用<|assistant_end|>收尾,会写工具调用。 - 能力:多选题按格式作答、数学题列式计算、写简单代码。
- 拔高:SFT 只能模仿示例,RL 可以按「对错」直接优化——示例里没有的策略也能被发现。