uncertainty-estimation

标签

Cards List
#uncertainty-estimation

卡尔曼增量网络:不确定性感知的联想记忆

Hugging Face Daily Papers · 2天前 缓存

介绍了卡尔曼增量网络,该网络通过将线性注意力重新表述为带有卡尔曼滤波更新的线性高斯状态空间模型来改进语言建模,以追踪记忆不确定性,从而产生比现有线性注意力模型性能更优的高效近似。

0 人收藏 0 人点赞
#uncertainty-estimation

从令牌到语义:利用互补信号在黑盒LLMs中检测幻觉

arXiv cs.CL · 6天前 缓存

本文提出通过结合语义熵和令牌级不确定性信号来检测黑盒LLMs中的幻觉的方法,评估了TopK、CoCoA、Gated和Stacked等技术在多个基准测试中的表现,发现没有单一方法普遍最强,但Stacked通常表现最佳。

0 人收藏 0 人点赞
#uncertainty-estimation

纵向贝叶斯学习在阿尔茨海默病连续谱中的连续疾病定位

arXiv cs.LG · 2026-08-21 缓存

本文提出疾病连续谱定位(DCP),一个纵向贝叶斯学习框架,可连续估计阿尔茨海默病的严重程度,并提供不确定性感知的疾病进展预测评分。

0 人收藏 0 人点赞
#uncertainty-estimation

快速分叉:高效估计文本生成中的不确定性动态

arXiv cs.CL · 2026-08-21 缓存

本文提出一种统计模型,用于高效估计文本生成中的不确定性动态,平滑嘈杂的重采样数据,以在保持LLM推理链分析准确性的同时显著降低计算成本。

0 人收藏 0 人点赞
#uncertainty-estimation

领域偏移下的可靠金融命名实体识别

arXiv cs.CL · 2026-08-21 缓存

本文研究了领域偏移下金融命名实体识别的置信度估计和选择性预测,评估了BERT和LoRA微调的Qwen模型,以提高在不同输入分布(如SEC文件和社交媒体)下的可靠性。

0 人收藏 0 人点赞
#uncertainty-estimation

H$^2$EDL: 用于层次分类的超证据深度学习

arXiv cs.LG · 2026-08-20 缓存

本文提出H2EDL,一种用于层次分类的超证据深度学习模型,它能捕捉标签层次结构中多层次的不确定性,减少校准误差,并在细粒度识别任务中提高粗粒度类别的保留率。

0 人收藏 0 人点赞
#uncertainty-estimation

口头过度自信的多维度:一项可解释性研究

arXiv cs.CL · 2026-08-20 缓存

本可解释性研究通过分析不确定性如何通过口头标记、弃权和数值分数表达,聚焦于Qwen3-4B,考察了大型语言模型中的过度自信现象,并提出了识别和缓解过度自信错误的方法。

0 人收藏 0 人点赞
#uncertainty-estimation

一个可解码性准则预测在大型语言模型中隐藏状态选择何时优于多数投票

arXiv cs.AI · 2026-08-19 缓存

本文提出CASE,一种动态选择组合器,使用可解码性准则来预测在大型语言模型中隐藏状态选择何时优于多数投票,从而提高在困难问题上的可靠性。

0 人收藏 0 人点赞
#uncertainty-estimation

不确定性不足时:代码生成中自我纠正的实证研究

arXiv cs.AI · 2026-08-18 缓存

本文实证研究了使用不确定性估计方法进行代码生成中的自我纠正,发现基于不确定性的方法未能提高Pass@1准确率,而基于验证的方法则取得了显著增益。

0 人收藏 0 人点赞
#uncertainty-estimation

用于LLM辅助系统综述筛选的辅助不确定性信号:一项跨八项Cohen药物类别综述的基准研究

arXiv cs.CL · 2026-08-18 缓存

本文对基于BERT+GCN分类器的辅助不确定性信号进行基准测试,以提高LLM辅助系统综述筛选的效率。研究表明,针对性地仅路由MAYBE结果可在接近基线的成本下实现效率最大化。

0 人收藏 0 人点赞
#uncertainty-estimation

大型语言模型中的稳定校准错误:高置信度错误的实用视角

arXiv cs.AI · 2026-08-17 缓存

本文探讨大型语言模型中的稳定校准错误现象,即高置信度错误在微小扰动下局部保持稳定。通过审计分数和探测等诊断方法评估校准程度和内部敏感性。

0 人收藏 0 人点赞
#uncertainty-estimation

Fisher8: Stabilizing Neural Heteroscedastic Regression via Output-Layer Fisher Geometry

arXiv cs.LG · 2026-08-12 缓存

This paper introduces Fisher8, an output-layer gradient correction that uses Fisher geometry instead of Euclidean geometry to stabilize neural heteroscedastic regression, improving uncertainty calibration and likelihood-error tradeoffs.

0 人收藏 0 人点赞
#uncertainty-estimation

使用物理信息深度学习从显微图像预测钢材疲劳寿命

arXiv cs.LG · 2026-08-03 缓存

本文介绍了 FatigueCV,一个物理信息深度学习框架,可在65毫秒内从光学显微图像预测钢材疲劳寿命,使用带不确定性估计的CNN。在合成显微图像上的验证显示出强劲性能(R²=0.93),但现实世界验证被列为未来工作。

0 人收藏 0 人点赞
#uncertainty-estimation

使用悲观评论家的协作加权方法缓解离策略强化学习中的过估计

arXiv cs.LG · 2026-07-30 缓存

提出了一种协作加权演员-评论家(CWAC)框架,该框架使用分布式评论家和协作加权机制来缓解离策略强化学习中的过估计偏差。

0 人收藏 0 人点赞
#uncertainty-estimation

小型视觉-语言模型知道自己错了但说不出来:一项关于在现实图像退化下陈述信心与内部信心的双模型研究

arXiv cs.CL · 2026-07-27 缓存

本文评估了小型开源视觉-语言模型(Qwen2-VL-2B和SmolVLM)如何处理现实图像退化,发现它们口头表达的信心不可靠,而内部令牌概率提供了更好的错误检测能力,尽管两者在严重低光条件下均失败。

0 人收藏 0 人点赞
#uncertainty-estimation

贝叶斯不确定性估计提升医疗AI代理的临床决策能力

arXiv cs.LG · 2026-07-24 缓存

本文表明,蒙特卡洛丢弃法能够为胸部X光片分类器提供认知不确定性信号,当以二元错误风险标志的方式传达时,可改善临床决策支持代理的错误检测,并减少自信误诊。

0 人收藏 0 人点赞
#uncertainty-estimation

面向多LLM系统中不确定性感知的信任估计方法:基于结构化专家判断

arXiv cs.LG · 2026-07-24 缓存

本文介绍了一种面向多LLM预测聚合的不确定性感知信任估计方法,该方法改编自结构化专家判断,采用库克风格对数加权来惩罚过度自信的错误预测。在MMLU和MMLU-Pro上的评估表明,该方法在异构和受污染的专家面板下实现了优越的准确性与可靠性平衡。

0 人收藏 0 人点赞
#uncertainty-estimation

随机采样在认知上是浅层的:大语言模型中温度变化与模型多样性之间的维度差距

arXiv cs.AI · 2026-07-24 缓存

本文研究了大语言模型(LLM)中的随机采样(自一致性)能否捕捉类似于多样化集成的跨问题结构。通过使用Marchenko–Pastur检验,作者发现,在单个模型内,随机变异最多产生一个显著维度,而24个模型的集成则产生四个,揭示了限制自一致性作为集成替代方案的维度差距。

0 人收藏 0 人点赞
#uncertainty-estimation

从评论家到置信度:用于语言定量预测与置信度估计的PPO

arXiv cs.CL · 2026-07-15 缓存

本文介绍了CARE-PPO,一种将置信度估计与PPO微调相结合的强化学习框架,用于基于语言的定量预测,使模型能够同时产生准确的数值估计和可靠的置信度信号,并在医疗和金融任务中进行了展示。

0 人收藏 0 人点赞
#uncertainty-estimation

使用分流解码的大语言模型幻觉检测

arXiv cs.CL · 2026-07-14 缓存

本文提出分流解码(diversion decoding)方法,通过在解码阶段主动挑战模型响应来提取特征,训练不确定性启发式模型,从而检测大语言模型中的幻觉,实现了更优的性能和更低的计算复杂度。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈