标签
本文提出PTTSD,一种从临床访谈转录中检测抑郁症严重程度的概率框架,该框架对不确定性进行建模并提供时间可解释性,在基准数据集上取得了具有竞争力的性能。
本文提出UASPL,一种将预测可靠性融入自步学习样本选择的方法,使用证据神经网络,提升了分类性能和可解释性。
本文对LLM在22种语言中的九种不确定性估计方法进行了大规模评估,发现提示模型用英语推理可改善低资源语言的不确定性估计,且方法的选择取决于模型规模。
提出了一种面向算法交易的不确定性感知强化学习框架,通过SHAP加权重构、MC Dropout和LSTM共识机制,整合了分布性、认知性和偶然性不确定性。在五大美国股票指数上,其表现优于传统模型。
引入SALT,一个具有确定性真实标签的基准,用于在长文本生成中评估LLM在细粒度原子级别的不确定性。对超过50个LLM的分析揭示了关于置信函数、错误传播以及与推理权衡的见解。
本文提出ASK+,一种在部分可观测环境(POMDP)中利用小型语言模型(SLM)对强化学习智能体进行不确定性门控辅助的方法。通过提供轨迹感知上下文和结构化思维链推理,ASK+显著提升了基准方法的成功率,证明提示设计和选择性门控对模型规模具有主导作用。
本文探究了大型语言模型是否能够通过模型内和模型间的聚合来近似群体智能效应,发现在八项估计任务中,平均绝对百分比误差(MAPE)显著降低高达37个百分点。
本文对大语言模型中基于探针的不确定性估计进行了分解研究,表明原始隐藏状态和注意力特征在域内表现良好,但结构化特征在分布偏移下更为鲁棒,并提供了预训练探针作为现成基线。
本文评估了社会科学文本分类典型条件下分类器性能指标的置信区间方法,为使用大语言模型时准确估计召回率、精确率等指标的区间提供了指导。
本文提出了一种概率框架,用于阿尔茨海默病进展预测,该框架结合了有序诊断预测、多时间点轨迹生成和分解不确定性估计,采用 Temporal Fusion Transformer 编码器和自回归混合密度网络。在ADNI数据上,该模型优于基线,实现了接近标称的90%可信区间覆盖率,并提供了具有临床意义的不确定性信号。
本文对4种模型和4种数据集设置下的24种黑盒不确定性估计方法进行了系统性回顾和基准测试,发现没有任何单一方法占主导地位,但结合多种不确定性信号的混合方法表现出色。
本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。
本文研究了从大语言模型中提取机器翻译输出置信度的口头化方法,并将其与内部token概率进行了比较。研究发现,尽管两种方法在错误检测和校准方面表现相似,但内部置信度与口头化置信度之间几乎没有相关性。
本文提出EcoTab,一种表格感知的逐步路由框架,分别估计表格标记和文本标记的不确定性,以动态地在小型和大型模型之间路由推理步骤,在表格推理任务上实现了更好的准确性与效率权衡。
Helicase是一个自主多Agent LLM系统,通过不确定性引导构建供应链知识图谱。它将复杂查询分解为可执行计划,并在新的SCQA基准上优于基线方法。
本文提出了一种用于作业车间调度的门控超启发式算法,该算法使用遗憾归一化的滚动标签和上下文KNN不确定性估计,以降低标签生成成本,并避免在预测改进不可信时切换出强默认规则。实验表明,该门控选择器实现了较低的均值相对百分比偏差,同时显著降低了计算成本。
提出了CSR,一种直接在语义空间中使用新颖的语义校准奖励来校准LLM的框架,在多个数据集上将ECE降低了高达40%,并将AUROC相较于口头化置信度基线提升了高达31%。
本文比较了交叉验证集成与深度集成在医学图像分割中的不确定性估计。深度集成在校准和故障检测方面优于交叉验证集成,而交叉验证集成能更好地近似评估者间变异性。
本文研究了增量决策树集成中的分歧漂移检测方法,发现在神经网络中有效的方法在树集成中表现不如基于损失的检测器,原因是模型塑性有限。