标签
介绍了Safe-Psych,一个用于评估大语言模型如何在精神科处理诊断不确定性的序贯基准,结果显示即使是强大的模型在临床证据不完整时也常常无法放弃诊断或寻求澄清。
本文介绍了 AgentAbstain,这是首个系统评估 LLM 智能体在适当时刻克制行动能力的框架,包含一个涵盖 8 种不作为场景的 263 个配对任务的基准测试。最佳智能体仅达到 59.5% 的配对准确率,揭示了一个与通用任务解决能力无关的关键差距。
本文定义了智能体回避问题,即决定大型语言模型智能体在不确定性下何时应停止行动的问题,并在网络购物、终端环境和问答场景中进行了评估。文章介绍了CONVOLVE,一种无需更新模型参数即可改善及时回避的上下文工程方法。
本文介绍了Know2Guess,一种污染感知的多区域基准,旨在评估大型语言模型从可回答知识到预期拒答的转换,解决数据污染、提示敏感性和拒绝行为问题。作者评估了FLAN-T5、Qwen2.5-Instruct和Llama-3-Instruct模型,发现更强的模型表现出选择性但不完全的拒答。该基准和数据集已公开发布。
OpenBioRQ 是一个包含12,553个未解决生物医学研究问题的新基准,用于测试智能体模型验证来源和避免虚假引用的能力。该基准揭示,当前模型经常链接到错误的论文,并在难题上出现智能体崩溃。
一篇被ICML 2026接收的论文提出了通过信息预算弃权门实现可预测幻觉的方法,并发布了ntkMirror——一种免训练的开源权重实现,通过在信息不足时弃权来减少幻觉,在约24%弃权率下实现0.0–0.7%的幻觉率。
本文认为,目前的自主智能体基准测试未能评估智能体是否应该继续执行任务,从而引入了'合规偏见'。作者提出了一个需要弃权的场景分类法,以及新的评估协议(Safety Rate, Usability Rate, Informed Refusal Rate),初步结果显示,不同模型家族的安全性与可用性之间存在可调节的权衡。
本文介绍了 SpatialUncertain,这是一个用于评估视觉语言模型能否识别因遮挡或视角模糊而无法回答空间问题的基准,揭示了模型过度自信和回避行为不佳的问题。
本文研究了毒性分类中的公平性问题,涵盖三个维度:排序、校准和弃权。比较了经验风险最小化(ERM)、加权ERM和群体分布鲁棒优化(Group DRO)方法,并结合后处理干预措施,发现校准差异是一种隐蔽的公平性违反,且弃权本身也可能不公平。
本文介绍了 NoisyCoconut,这是一种在推理阶段通过向潜在轨迹注入噪声以生成多样化推理路径从而提高大语言模型可靠性的方法。该方法使模型能够在不确定时选择拒答,从而在无需重新训练的情况下显著降低数学推理任务的错误率。