uncertainty-estimation

标签

Cards List
#uncertainty-estimation

Helicase:基于不确定性引导的自主多Agent LLM供应链知识图谱构建

arXiv cs.AI · 2026-05-27 缓存

Helicase是一个自主多Agent LLM系统,通过不确定性引导构建供应链知识图谱。它将复杂查询分解为可执行计划,并在新的SCQA基准上优于基线方法。

0 人收藏 0 人点赞
#uncertainty-estimation

低成本标签,可靠选择:用于作业车间调度的Rollout校准超启发式算法

arXiv cs.AI · 2026-05-26 缓存

本文提出了一种用于作业车间调度的门控超启发式算法,该算法使用遗憾归一化的滚动标签和上下文KNN不确定性估计,以降低标签生成成本,并避免在预测改进不可信时切换出强默认规则。实验表明,该门控选择器实现了较低的均值相对百分比偏差,同时显著降低了计算成本。

0 人收藏 0 人点赞
#uncertainty-estimation

基于语义级奖励的LLM校准

arXiv cs.CL · 2026-05-18 缓存

提出了CSR,一种直接在语义空间中使用新颖的语义校准奖励来校准LLM的框架,在多个数据集上将ECE降低了高达40%,并将AUROC相较于口头化置信度基线提升了高达31%。

0 人收藏 0 人点赞
#uncertainty-estimation

迷失在折叠中:交叉验证并非不确定性估计的深度集成

Hugging Face Daily Papers · 2026-05-18 缓存

本文比较了交叉验证集成与深度集成在医学图像分割中的不确定性估计。深度集成在校准和故障检测方面优于交叉验证集成,而交叉验证集成能更好地近似评估者间变异性。

0 人收藏 0 人点赞
#uncertainty-estimation

流式树集成中无标签分歧漂移检测的陷阱

arXiv cs.LG · 2026-05-14 缓存

本文研究了增量决策树集成中的分歧漂移检测方法,发现在神经网络中有效的方法在树集成中表现不如基于损失的检测器,原因是模型塑性有限。

0 人收藏 0 人点赞
#uncertainty-estimation

分布过程奖励模型:通过条件最优传输校准未来奖励的预测

arXiv cs.LG · 2026-05-11 缓存

本文引入了分布过程奖励模型,利用条件最优传输对 PRM 进行校准,以提高推理时缩放(inference-time scaling)中成功概率估计的准确性。该研究在 MATH-500 和 AIME 等数学推理基准测试中展示了改进的校准效果和下游性能。

0 人收藏 0 人点赞
#uncertainty-estimation

从大型语言模型的序列内部离散中学习不确定性

arXiv cs.CL · 2026-04-20 缓存

本文介绍了SIVR(序列内部方差表示),一个有监督框架,通过分析隐层状态中的逐token和逐层方差模式来检测LLM中的幻觉现象,无需依赖严格的架构假设。该方法聚合完整序列方差特征来学习事实错误的时间模式,并在较小训练集上表现出更好的泛化能力。

0 人收藏 0 人点赞
#uncertainty-estimation

如何打造“谦逊”的AI

MIT News — Artificial Intelligence · 2026-03-24 缓存

MIT研究人员提出了一种用于医疗领域的“谦逊”AI框架,鼓励系统表达不确定性,并以协作副驾驶而非权威预言者的身份发挥作用。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈