标签
介绍TELL,一种AI生成文本检测系统,它在提供数值评分的同时给出可解释的标注,实现了具有竞争力的AUROC 0.927,并允许用户根据高亮的文本指标判断作者身份。
本文介绍了归因合同(Attribution Contract),这是生成式语言模型中特征归因声明的一种规范,解决了特征定义不清以及归因方法评估方式模糊的问题。论文以自回归模型和扩散模型为例,展示了归因何时具有信息量,何时可能产生误导。
文章认为,AI在2026年的主要挑战并非技术开发,而是如何向习惯于确定性保证的传统利益相关者沟通概率性输出,这需要解释和说服的技巧。
INSIGHTS 是一种模型无关的方法,通过生成多样化、信息丰富的样本摘要来提供时间序列模型的全局解释,这些摘要捕捉特定领域的行为,在用户研究中优于局部归因方法。
本文提出了一种专门用于可解释虚假信息检测的LLM微调流水线,并介绍了一种数据合成方法LonsRex,用于生成必要且充分的解释,解决了仅基于标签正确性进行简单过滤的局限性。
本文提出了GESD,一种面向过程的公平性度量,用于衡量不同子组之间解释稳定性的差异,并将其集成到一个多目标优化框架中,以联合优化效用、结果公平性和解释公平性。
FairHealth 是一个专为资源匮乏环境下的可信医疗AI设计的开源Python库,提供公平性审计、隐私保护型联邦学习和可解释性模块。
作者详细阐述了不让LLM生成最终事实核查判定的决定,转而采用混合架构:LLM负责数据提取,确定性Python层负责评分,并指出了随机不稳定性和可审计性的问题。
本文介绍了“模型到数据 (M2D)”蒸馏框架,该框架通过将复杂性从图神经网络转移到数据空间,从而提升架构的透明度和可解释性。
TriEx提出一种三视角博弈框架,将自我推理、对手信念状态与神谕审计对齐,使多智能体LLM决策可被审计,并揭示所述理由与实际行为之间的错配。
北京大学研究人员提出了CFMS,这是首个细粒度中文多模态讽刺检测基准,包含2,796个图像-文本对和三级标注框架(讽刺识别、目标识别、解释生成),以及一种新颖的强化学习增强上下文学习方法(PGDS),该方法显著优于现有基线。
一份综合调查,回顾了大语言模型(LLM)固有可解释性的最新进展,将方法分为五个设计范式:功能透明性、概念对齐、表示可分解性、显式模块化和潜在稀疏性诱导。论文解决了在模型架构中直接构建透明性,而不是依赖事后解释方法的挑战。
一项对比研究,评估了三种可解释性技术(Integrated Gradients、Attention Rollout、SHAP)在微调 DistilBERT 模型上的表现,用于情感分类任务,重点突出了基于梯度、基于注意力和模型无关方法在大语言模型可解释性中的权衡。
# 语言模型可以解释语言模型中的神经元 来源:[https://openai.com/index/language-models-can-explain-neurons-in-language-models/](https://openai.com/index/language-models-can-explain-neurons-in-language-models/) 虽然我们的大多数解释得分较低,但我们相信现在可以使用机器学习技术进一步改进我们生成解释的能力。例如,我们发现我们能够通过以下方式提高得分:- *迭代解释*。我们可以通过增加得分来
# 激活图谱简介 来源:[https://openai.com/index/introducing-activation-atlases/](https://openai.com/index/introducing-activation-atlases/) 理解神经网络内部工作原理不仅仅是科学好奇心的问题——我们的知识缺陷限制了审计神经网络的能力,在高风险场景中,确保其安全性。通常,如果要部署关键软件,可以审查代码的所有执行路径,但
本文讨论了人工智能可解释性的重要性,重点介绍了思维链推理作为理解神经网络内部工作原理的工具,并分析了其当前的有效性、局限性以及未来更强大模型可能带来的解读挑战。