model-training (11)AccelerateAccelerate — 大模型 offload 与 device_map本页总览数据截至 2026-08-20(上游 commit fd01e35c83d8)05 · 大模型 offload 与 device_map 这一章讲什么: 一张 24GB 的卡怎么跑 70B 模型?答案不是并行,而是「时间换空间」:参数平时躺在 CPU 内存甚至磁盘上,forward 执行到某一层时才把该层权重搬上 GPU,算完立刻卸掉。这套机制就是 transformers 里 device_map="auto" 的底层。 1. 它要解决的小问题