@johnschulman2: 非常看好这个方向。有了解释质量的衡量指标,就可以通过爬山法来优化,而反事实可模拟性……
摘要
John Schulman 重点介绍了 Adam Karvonen 及其同事的研究,该研究将反事实可模拟性作为提升 AI 解释质量的指标。他们开发了数据集与流水线,训练模型对自身行为生成更优的事后解释,并在留出评估中展现了泛化能力。
查看缓存全文
缓存时间: 2026/09/06 08:46
非常看好这个方向。有了解释质量的评估指标,就可以进行迭代优化(hillclimb),而且反事实可模拟性(counterfactual simulatability)听起来也很合理。Adam 等人构建了数据集和流水线,生成的测试用例比以往工作更多样、更真实,并基于此开展了有趣的实验。正如这条推文串所强调的,我们还可以训练模型为其行为写出更好的事后解释(post-hoc explanations)。
Adam Karvonen (@a_karvonen): 模型能否学会解释自己的行为,例如为什么忽略了用户请求,或者为什么出现了代码错误?
我们使用数千条对模型自身真实场景(in-the-wild)行为的解释来训练模型。
仅在这个通用数据集上训练,就能在留出(held-out)的评估上展现出泛化能力。
🧵
相似文章
CEL:全面的反事实解释库与基准测试
介绍CEL,一个统一的反事实解释库和基准测试,提供了18个数据集上14种方法的标准化实现,以实现在可解释AI中的公平比较。
评估自然语言解释中的判断质量:来自预测锦标赛的证据
本文介绍了解释质量标记(EQMs),这是一组由大语言模型评分的60种推理模式,用于衡量预测锦标赛中自然语言解释的质量。通过分析超过55,000个预测-理由配对,EQMs在预测层面和预测者层面都预测了准确性,优于之前的方法。
ExplainBench:评估代理生成的代码解释
ExplainBench 是一个新的基准测试,用于评估编码代理生成的解释的可信度。研究表明,解释质量是代理评估的一个独立维度,且审计代理能够自动提升解释的可靠性。
CAS:用于局部和全局可解释人工智能的因果归因评分
介绍了CAS,一种用于局部和全局可解释AI的因果归因评分,它将预测重要性与因果效应异质性区分开来,并在基准测试和实证数据集上进行了验证。
有效的解释支持不确定性下的规划
本研究论文提出了一种计算模型,通过模拟过程性解释在不确定性下如何指导行动规划来评估其有效性。通过四项实验,作者表明,被该模型赋予更高分数的解释被认为更有用,并能带来更好的导航表现。