研究系列
Training Data Attribution for NLP and LLM Research
这是一个面向 thesis 和面试的研究系列:归因单位、utility、Shapley、ablation、因果证据、样本级方法、 可扩展性、不确定性、验证,以及博士阶段可继续扩展的问题。
第二部分
Coalition context 下的贡献
第三部分
方法、扩展与不确定性
这个系列怎么用
目标不是写成普通教程,而是让你的 thesis 更能讲清楚、更能 defend,也更容易自然延伸到 PhD。
面试可讲
每篇都有 spoken-style answer,可以改成项目面试或 PhD 面试里的回答。
研究边界清楚
系列会区分 attribution unit、utility、estimator、intervention 和 uncertainty,避免 overclaim。
博士方向明确
后半部分自然指向 hierarchical attribution、intervention validation 和 LLM factuality/style attribution。
先从“归因到底能声称什么”开始。
强的 attribution 项目,首先要有清楚的单位、清楚的 utility 和谨慎的结论边界。