数据截至 (上游 commit 1416fa0cf215)
Open R1 — 一份可运行的推理模型训练配方
30 秒导读: Open R1 是 Hugging Face 对 DeepSeek-R1 训练管线的完全开放复现。它不是框架——全部训练逻辑只有
sft.py(169 行)和grpo.py(181 行)两个薄脚本,训练器直接借自 trl。这个仓库真正的价值在别处:一套写得明明白白、可以直接 sbatch 跑起来的 R1 级模型配方——每个模型一个 YAML、每个阶段一条命令、训练中途自动跑 benchmark、连 Slurm 集群脚本都给了。想知道「复现一个推理模型到底要做哪些事」,读这个仓库比读论文快。
1. 这是什么(零基础也能懂)
一句话定义
Open R1 是一套训练配方仓库