uncertainty-estimation

标签

Cards List
#uncertainty-estimation

概率文本时间序列抑郁症检测

arXiv cs.CL · 2026-07-13 缓存

本文提出PTTSD,一种从临床访谈转录中检测抑郁症严重程度的概率框架,该框架对不确定性进行建模并提供时间可解释性,在基准数据集上取得了具有竞争力的性能。

0 人收藏 0 人点赞
#uncertainty-estimation

UASPL:基于证据神经网络的不确定性感知自步学习

arXiv cs.LG · 2026-07-09 缓存

本文提出UASPL,一种将预测可靠性融入自步学习样本选择的方法,使用证据神经网络,提升了分类性能和可解释性。

0 人收藏 0 人点赞
#uncertainty-estimation

基于推理的不确定性估计:LLM在多语言和跨语言MCQA性能中的大规模研究

arXiv cs.CL · 2026-07-08 缓存

本文对LLM在22种语言中的九种不确定性估计方法进行了大规模评估,发现提示模型用英语推理可改善低资源语言的不确定性估计,且方法的选择取决于模型规模。

0 人收藏 0 人点赞
#uncertainty-estimation

交易信心:算法交易中的全面不确定性估计

arXiv cs.LG · 2026-07-07 缓存

提出了一种面向算法交易的不确定性感知强化学习框架,通过SHAP加权重构、MC Dropout和LSTM共识机制,整合了分布性、认知性和偶然性不确定性。在五大美国股票指数上,其表现优于传统模型。

0 人收藏 0 人点赞
#uncertainty-estimation

使用确定性真实标签评估长文本生成中的LLM不确定性

arXiv cs.AI · 2026-07-07 缓存

引入SALT,一个具有确定性真实标签的基准,用于在长文本生成中评估LLM在细粒度原子级别的不确定性。对超过50个LLM的分析揭示了关于置信函数、错误传播以及与推理权衡的见解。

0 人收藏 0 人点赞
#uncertainty-estimation

ASK in the Dark: 部分可观测环境下的不确定性门控大语言模型辅助

arXiv cs.AI · 2026-07-07 缓存

本文提出ASK+,一种在部分可观测环境(POMDP)中利用小型语言模型(SLM)对强化学习智能体进行不确定性门控辅助的方法。通过提供轨迹感知上下文和结构化思维链推理,ASK+显著提升了基准方法的成功率,证明提示设计和选择性门控对模型规模具有主导作用。

0 人收藏 0 人点赞
#uncertainty-estimation

(AI)群体的智慧:探究大型语言模型中的人工群体智能

arXiv cs.AI · 2026-07-01 缓存

本文探究了大型语言模型是否能够通过模型内和模型间的聚合来近似群体智能效应,发现在八项估计任务中,平均绝对百分比误差(MAPE)显著降低高达37个百分点。

0 人收藏 0 人点赞
#uncertainty-estimation

从信号到迁移:基于探针的大语言模型不确定性估计的分解研究

arXiv cs.CL · 2026-06-29 缓存

本文对大语言模型中基于探针的不确定性估计进行了分解研究,表明原始隐藏状态和注意力特征在域内表现良好,但结构化特征在分布偏移下更为鲁棒,并提供了预训练探针作为现成基线。

0 人收藏 0 人点赞
#uncertainty-estimation

分类器性能不确定性估计及其在大语言模型与嵌套数据中的应用

arXiv cs.AI · 2026-06-26 缓存

本文评估了社会科学文本分类典型条件下分类器性能指标的置信区间方法,为使用大语言模型时准确估计召回率、精确率等指标的区间提供了指导。

0 人收藏 0 人点赞
#uncertainty-estimation

利用深度学习进行具有不确定性意识的阿尔茨海默病进展纵向预测

arXiv cs.AI · 2026-06-24 缓存

本文提出了一种概率框架,用于阿尔茨海默病进展预测,该框架结合了有序诊断预测、多时间点轨迹生成和分解不确定性估计,采用 Temporal Fusion Transformer 编码器和自回归混合密度网络。在ADNI数据上,该模型优于基线,实现了接近标称的90%可信区间覆盖率,并提供了具有临床意义的不确定性信号。

0 人收藏 0 人点赞
#uncertainty-estimation

大型语言模型黑盒不确定性估计方法的系统性评估

arXiv cs.AI · 2026-06-20 缓存

本文对4种模型和4种数据集设置下的24种黑盒不确定性估计方法进行了系统性回顾和基准测试,发现没有任何单一方法占主导地位,但结合多种不确定性信号的混合方法表现出色。

0 人收藏 0 人点赞
#uncertainty-estimation

面向LLM Agent澄清请求的不确定性分解

arXiv cs.AI · 2026-06-20 缓存

本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。

0 人收藏 0 人点赞
#uncertainty-estimation

自我评价之言:大语言模型在机器翻译中的口头化置信度研究

arXiv cs.CL · 2026-06-17 缓存

本文研究了从大语言模型中提取机器翻译输出置信度的口头化方法,并将其与内部token概率进行了比较。研究发现,尽管两种方法在错误检测和校准方面表现相似,但内部置信度与口头化置信度之间几乎没有相关性。

0 人收藏 0 人点赞
#uncertainty-estimation

现代深度学习的不确定性估计与泛化界限

arXiv cs.LG · 2026-06-15 缓存

本文提出了现代深度学习模型不确定性估计与泛化的理论界限。

0 人收藏 0 人点赞
#uncertainty-estimation

重新思考逐步模型路由:一种面向表格推理的成本高效视角

arXiv cs.CL · 2026-05-29 缓存

本文提出EcoTab,一种表格感知的逐步路由框架,分别估计表格标记和文本标记的不确定性,以动态地在小型和大型模型之间路由推理步骤,在表格推理任务上实现了更好的准确性与效率权衡。

0 人收藏 0 人点赞
#uncertainty-estimation

Helicase:基于不确定性引导的自主多Agent LLM供应链知识图谱构建

arXiv cs.AI · 2026-05-27 缓存

Helicase是一个自主多Agent LLM系统,通过不确定性引导构建供应链知识图谱。它将复杂查询分解为可执行计划,并在新的SCQA基准上优于基线方法。

0 人收藏 0 人点赞
#uncertainty-estimation

低成本标签,可靠选择:用于作业车间调度的Rollout校准超启发式算法

arXiv cs.AI · 2026-05-26 缓存

本文提出了一种用于作业车间调度的门控超启发式算法,该算法使用遗憾归一化的滚动标签和上下文KNN不确定性估计,以降低标签生成成本,并避免在预测改进不可信时切换出强默认规则。实验表明,该门控选择器实现了较低的均值相对百分比偏差,同时显著降低了计算成本。

0 人收藏 0 人点赞
#uncertainty-estimation

基于语义级奖励的LLM校准

arXiv cs.CL · 2026-05-18 缓存

提出了CSR,一种直接在语义空间中使用新颖的语义校准奖励来校准LLM的框架,在多个数据集上将ECE降低了高达40%,并将AUROC相较于口头化置信度基线提升了高达31%。

0 人收藏 0 人点赞
#uncertainty-estimation

迷失在折叠中:交叉验证并非不确定性估计的深度集成

Hugging Face Daily Papers · 2026-05-18 缓存

本文比较了交叉验证集成与深度集成在医学图像分割中的不确定性估计。深度集成在校准和故障检测方面优于交叉验证集成,而交叉验证集成能更好地近似评估者间变异性。

0 人收藏 0 人点赞
#uncertainty-estimation

流式树集成中无标签分歧漂移检测的陷阱

arXiv cs.LG · 2026-05-14 缓存

本文研究了增量决策树集成中的分歧漂移检测方法,发现在神经网络中有效的方法在树集成中表现不如基于损失的检测器,原因是模型塑性有限。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈