@johnschulman2: 非常看好这个方向。有了解释质量的衡量指标,就可以通过爬山法来优化,而反事实可模拟性……

X AI KOLs Timeline 论文

摘要

John Schulman 重点介绍了 Adam Karvonen 及其同事的研究,该研究将反事实可模拟性作为提升 AI 解释质量的指标。他们开发了数据集与流水线,训练模型对自身行为生成更优的事后解释,并在留出评估中展现了泛化能力。

非常看好这个方向。有了解释质量的衡量指标,就可以通过爬山法来优化,而反事实可模拟性看起来是合理的。Adam 等人创建了数据集和流水线,生成的测试用例比以往工作更加多样和真实,并在此基础上开展了有趣的实验。还可以训练模型写出更好的关于自身行为的事后解释,正如本帖重点介绍的那样。
查看原文
查看缓存全文

缓存时间: 2026/09/06 08:46

非常看好这个方向。有了解释质量的评估指标,就可以进行迭代优化(hillclimb),而且反事实可模拟性(counterfactual simulatability)听起来也很合理。Adam 等人构建了数据集和流水线,生成的测试用例比以往工作更多样、更真实,并基于此开展了有趣的实验。正如这条推文串所强调的,我们还可以训练模型为其行为写出更好的事后解释(post-hoc explanations)。

Adam Karvonen (@a_karvonen): 模型能否学会解释自己的行为,例如为什么忽略了用户请求,或者为什么出现了代码错误?

我们使用数千条对模型自身真实场景(in-the-wild)行为的解释来训练模型。

仅在这个通用数据集上训练,就能在留出(held-out)的评估上展现出泛化能力。

🧵

相似文章

评估自然语言解释中的判断质量:来自预测锦标赛的证据

arXiv cs.CL

本文介绍了解释质量标记(EQMs),这是一组由大语言模型评分的60种推理模式,用于衡量预测锦标赛中自然语言解释的质量。通过分析超过55,000个预测-理由配对,EQMs在预测层面和预测者层面都预测了准确性,优于之前的方法。

ExplainBench:评估代理生成的代码解释

Hugging Face Daily Papers

ExplainBench 是一个新的基准测试,用于评估编码代理生成的解释的可信度。研究表明,解释质量是代理评估的一个独立维度,且审计代理能够自动提升解释的可靠性。

有效的解释支持不确定性下的规划

arXiv cs.CL

本研究论文提出了一种计算模型,通过模拟过程性解释在不确定性下如何指导行动规划来评估其有效性。通过四项实验,作者表明,被该模型赋予更高分数的解释被认为更有用,并能带来更好的导航表现。