uncertainty-estimation

标签

Cards List
#uncertainty-estimation

贝叶斯不确定性估计提升医疗AI代理的临床决策能力

arXiv cs.LG · 昨天 缓存

本文表明,蒙特卡洛丢弃法能够为胸部X光片分类器提供认知不确定性信号,当以二元错误风险标志的方式传达时,可改善临床决策支持代理的错误检测,并减少自信误诊。

0 人收藏 0 人点赞
#uncertainty-estimation

面向多LLM系统中不确定性感知的信任估计方法:基于结构化专家判断

arXiv cs.LG · 昨天 缓存

本文介绍了一种面向多LLM预测聚合的不确定性感知信任估计方法,该方法改编自结构化专家判断,采用库克风格对数加权来惩罚过度自信的错误预测。在MMLU和MMLU-Pro上的评估表明,该方法在异构和受污染的专家面板下实现了优越的准确性与可靠性平衡。

0 人收藏 0 人点赞
#uncertainty-estimation

随机采样在认知上是浅层的:大语言模型中温度变化与模型多样性之间的维度差距

arXiv cs.AI · 昨天 缓存

本文研究了大语言模型(LLM)中的随机采样(自一致性)能否捕捉类似于多样化集成的跨问题结构。通过使用Marchenko–Pastur检验,作者发现,在单个模型内,随机变异最多产生一个显著维度,而24个模型的集成则产生四个,揭示了限制自一致性作为集成替代方案的维度差距。

0 人收藏 0 人点赞
#uncertainty-estimation

从评论家到置信度:用于语言定量预测与置信度估计的PPO

arXiv cs.CL · 2026-07-15 缓存

本文介绍了CARE-PPO,一种将置信度估计与PPO微调相结合的强化学习框架,用于基于语言的定量预测,使模型能够同时产生准确的数值估计和可靠的置信度信号,并在医疗和金融任务中进行了展示。

0 人收藏 0 人点赞
#uncertainty-estimation

使用分流解码的大语言模型幻觉检测

arXiv cs.CL · 2026-07-14 缓存

本文提出分流解码(diversion decoding)方法,通过在解码阶段主动挑战模型响应来提取特征,训练不确定性启发式模型,从而检测大语言模型中的幻觉,实现了更优的性能和更低的计算复杂度。

0 人收藏 0 人点赞
#uncertainty-estimation

概率文本时间序列抑郁症检测

arXiv cs.CL · 2026-07-13 缓存

本文提出PTTSD,一种从临床访谈转录中检测抑郁症严重程度的概率框架,该框架对不确定性进行建模并提供时间可解释性,在基准数据集上取得了具有竞争力的性能。

0 人收藏 0 人点赞
#uncertainty-estimation

UASPL:基于证据神经网络的不确定性感知自步学习

arXiv cs.LG · 2026-07-09 缓存

本文提出UASPL,一种将预测可靠性融入自步学习样本选择的方法,使用证据神经网络,提升了分类性能和可解释性。

0 人收藏 0 人点赞
#uncertainty-estimation

基于推理的不确定性估计:LLM在多语言和跨语言MCQA性能中的大规模研究

arXiv cs.CL · 2026-07-08 缓存

本文对LLM在22种语言中的九种不确定性估计方法进行了大规模评估,发现提示模型用英语推理可改善低资源语言的不确定性估计,且方法的选择取决于模型规模。

0 人收藏 0 人点赞
#uncertainty-estimation

交易信心:算法交易中的全面不确定性估计

arXiv cs.LG · 2026-07-07 缓存

提出了一种面向算法交易的不确定性感知强化学习框架,通过SHAP加权重构、MC Dropout和LSTM共识机制,整合了分布性、认知性和偶然性不确定性。在五大美国股票指数上,其表现优于传统模型。

0 人收藏 0 人点赞
#uncertainty-estimation

使用确定性真实标签评估长文本生成中的LLM不确定性

arXiv cs.AI · 2026-07-07 缓存

引入SALT,一个具有确定性真实标签的基准,用于在长文本生成中评估LLM在细粒度原子级别的不确定性。对超过50个LLM的分析揭示了关于置信函数、错误传播以及与推理权衡的见解。

0 人收藏 0 人点赞
#uncertainty-estimation

ASK in the Dark: 部分可观测环境下的不确定性门控大语言模型辅助

arXiv cs.AI · 2026-07-07 缓存

本文提出ASK+,一种在部分可观测环境(POMDP)中利用小型语言模型(SLM)对强化学习智能体进行不确定性门控辅助的方法。通过提供轨迹感知上下文和结构化思维链推理,ASK+显著提升了基准方法的成功率,证明提示设计和选择性门控对模型规模具有主导作用。

0 人收藏 0 人点赞
#uncertainty-estimation

(AI)群体的智慧:探究大型语言模型中的人工群体智能

arXiv cs.AI · 2026-07-01 缓存

本文探究了大型语言模型是否能够通过模型内和模型间的聚合来近似群体智能效应,发现在八项估计任务中,平均绝对百分比误差(MAPE)显著降低高达37个百分点。

0 人收藏 0 人点赞
#uncertainty-estimation

从信号到迁移:基于探针的大语言模型不确定性估计的分解研究

arXiv cs.CL · 2026-06-29 缓存

本文对大语言模型中基于探针的不确定性估计进行了分解研究,表明原始隐藏状态和注意力特征在域内表现良好,但结构化特征在分布偏移下更为鲁棒,并提供了预训练探针作为现成基线。

0 人收藏 0 人点赞
#uncertainty-estimation

分类器性能不确定性估计及其在大语言模型与嵌套数据中的应用

arXiv cs.AI · 2026-06-26 缓存

本文评估了社会科学文本分类典型条件下分类器性能指标的置信区间方法,为使用大语言模型时准确估计召回率、精确率等指标的区间提供了指导。

0 人收藏 0 人点赞
#uncertainty-estimation

利用深度学习进行具有不确定性意识的阿尔茨海默病进展纵向预测

arXiv cs.AI · 2026-06-24 缓存

本文提出了一种概率框架,用于阿尔茨海默病进展预测,该框架结合了有序诊断预测、多时间点轨迹生成和分解不确定性估计,采用 Temporal Fusion Transformer 编码器和自回归混合密度网络。在ADNI数据上,该模型优于基线,实现了接近标称的90%可信区间覆盖率,并提供了具有临床意义的不确定性信号。

0 人收藏 0 人点赞
#uncertainty-estimation

大型语言模型黑盒不确定性估计方法的系统性评估

arXiv cs.AI · 2026-06-20 缓存

本文对4种模型和4种数据集设置下的24种黑盒不确定性估计方法进行了系统性回顾和基准测试,发现没有任何单一方法占主导地位,但结合多种不确定性信号的混合方法表现出色。

0 人收藏 0 人点赞
#uncertainty-estimation

面向LLM Agent澄清请求的不确定性分解

arXiv cs.AI · 2026-06-20 缓存

本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。

0 人收藏 0 人点赞
#uncertainty-estimation

自我评价之言:大语言模型在机器翻译中的口头化置信度研究

arXiv cs.CL · 2026-06-17 缓存

本文研究了从大语言模型中提取机器翻译输出置信度的口头化方法,并将其与内部token概率进行了比较。研究发现,尽管两种方法在错误检测和校准方面表现相似,但内部置信度与口头化置信度之间几乎没有相关性。

0 人收藏 0 人点赞
#uncertainty-estimation

现代深度学习的不确定性估计与泛化界限

arXiv cs.LG · 2026-06-15 缓存

本文提出了现代深度学习模型不确定性估计与泛化的理论界限。

0 人收藏 0 人点赞
#uncertainty-estimation

重新思考逐步模型路由:一种面向表格推理的成本高效视角

arXiv cs.CL · 2026-05-29 缓存

本文提出EcoTab,一种表格感知的逐步路由框架,分别估计表格标记和文本标记的不确定性,以动态地在小型和大型模型之间路由推理步骤,在表格推理任务上实现了更好的准确性与效率权衡。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈