model-training (11)OLMoOLMo — 训练中途的评测:域困惑度与下游任务本页总览数据截至 2025-11-24(上游 commit 090253dac668)04 · 训练中途的评测:域困惑度与下游任务 这一章讲什么: olmo/eval/ 怎么把评测做成训练循环的一部分(in-loop evaluation),以及「多选题用 loglikelihood 对比来答」这套标准 ICL 评测的具体实现。 1. 它要解决的小问题