· Xiaojing Yang · Explainability and Responsible AI
Ablation vs Shapley:为什么 Coalition Context 重要
Ablation 简单且有用,但 Shapley 通过跨多个 coalition context 平均边际贡献,回答更全面的问题。
Ablation 简单且有用,但 Shapley 通过跨多个 coalition context 平均边际贡献,回答更全面的问题。
Training-data attribution 可以提供数据影响的证据,但因果声称需要谨慎的干预、重新训练、控制条件和不确定性分析。
为什么 attribution unit 很关键:数据源、数据组、文档、样本和 token 层面的归因回答的是不同研究问题,也支持不同证据强度。
数据归因中的 Shapley 基础:coalition value、边际贡献、跨上下文平均,以及为什么它比一次 ablation 更全面。
如何通过删除、修正、重加权、counterfactual examples、重新训练和随机删除 baseline 来验证数据归因。
面向 NLP 的样本级归因方法比较:gradient similarity、influence functions 与 TracIn,以及它们的假设和局限。