数据漂移与统计检验:分布怎么比、20+ stattest 怎么组织
30 秒导读: 模型上线后,线上数据会慢慢"变味"——今天进来的特征分布,和当初训练/评估时的分布不再一样,这叫数据漂移(data drift)。Evidently 检测漂移的做法极其朴素:把"现在的分布"(current)和"基准分布"(reference)放一起比一比,差异超过阈值就报 drift。难点全在"怎么比":数值列、类别列、文本列各有各的比法。Evidently 把 20 多种"比法"做成一张可插拔的注册表——每个统计检验(statistical test,简称 stattest)都是一个统一签名的小函数,返回
(距离/差异值, 是否漂移)。本章讲清这个统计内核:注册表机制、几个代表性检验的公式直觉,以及上层的漂移 metric / preset 如何"选检验、逐列跑、汇总成漂移列占比"。
本章聚焦统计检验这一类计算的内核与选择逻辑。metric / preset 的通用引擎机制(Metric 类型、Context 缓存、Report→Snapshot)已在 02-metrics-engine.md 讲透,这里只补"漂移这类计算里,统计检验是怎么被选中、被调用、被聚合的"。