· Xiaojing Yang · Statistics · 4 min read

EN

模型评估中的 Bootstrap Resampling

Bootstrap 通过反复重采样已有测试集,估计模型分数和模型差异的不确定性。

核心观点

Bootstrap 问的是:如果我只有这个测试集,反复重采样后分数会怎么波动?

1. 直觉

在很多 AI 项目里,重新收集一个大测试集很贵。Bootstrap 给了我们一种实用方法:用已经有的测试集估计不确定性。

Bootstrap 循环
原始测试集
N 个已评估样本
有放回重采样
构造一个伪测试集
计算指标
BLEU、chrF、accuracy、COMET、F1
重复
几百或几千次
总结
区间或差异分布

2. 为什么是有放回抽样?

有放回抽样允许某个样本出现多次,另一个样本完全不出现。这是在模拟:我们手上的测试集只是更大总体中的一次抽样。

original: [1, 2, 3, 4, 5]
sample:   [2, 2, 4, 5, 5]

bootstrap 得到的分数分布,可以告诉我们指标对测试集组成有多敏感。

3. 模型比较

对于 MT、摘要、分类这类同一批样本上的 paired tasks,bootstrap 更常用于比较系统差异,而不只是估计单个分数。

单模型 bootstrap

这个模型分数有多不确定?

配对 bootstrap

两个系统的差异有多稳定?

4. AI/NLP 例子

对于 English—Norwegian 领域机器翻译,我会在句对层面做 bootstrap。每个重采样测试集都为两个系统计算 BLEU、chrF、COMET。如果大多数重采样都显示 LoRA 优于 baseline,这比单一分数表更有证据力。

5. 局限

Bootstrap 不能修复坏测试集。如果测试集本身有偏、小、重复、缺少困难领域样本,bootstrap 只能估计这个有缺陷样本附近的不确定性。

总结

Bootstrap 是统计和 AI 评估之间最实用的桥之一:它不要求新数据,却能让不确定性可见。

参考资料和学习路线

这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。

Share:
Back to Blog

Related Posts

View All Posts »