· Xiaojing Yang · Explainability and Responsible AI
Utility Functions:我们到底在解释哪种模型行为?
Training-data attribution 依赖 utility function。质量、事实性、风格、安全、公平性和术语表现可能指向不同的高影响数据。
Training-data attribution 依赖 utility function。质量、事实性、风格、安全、公平性和术语表现可能指向不同的高影响数据。
从 NLP 与 LLM 研究角度解释 training-data attribution:它解释什么、它和 feature attribution 有什么不同,以及为什么它对模型评估和数据中心研究重要。
ANOVA asks whether group-level variation is larger than within-group noise.
Attention as a learned way to decide what context matters for each token.
Bias and variance explain why both too-simple and too-flexible models can fail.
A practical diagnosis map for underfitting, overfitting, model complexity, and generalization.