标签
本文介绍了鲁棒模糊性检测(RAD)框架,该框架利用模型空间和特征空间的一致性度量来量化预测模糊性,并指导机器学习模型进行弃权预测。
本文提出了Archive,一个用于开放域问答中歧义检测的框架,利用逻辑冲突区分歧义与答案多样性,并引入了包含4,703个查询的基准QuireQA。实验表明,Archive将F1最高提升21.6%,同时比竞争对手快16倍。
DiscoBench 是一个新基准,用于评估基于 LLM 的搜索代理能否主动识别用户查询中的歧义、提出澄清性问题,并通过多轮交互恢复正确的推理路径。