uncertainty-estimation

标签

Cards List
#uncertainty-estimation

面向半导体制造的不确定性与业务感知剩余使用寿命估计

arXiv cs.LG ↗ · 4天前 缓存

本文提出了一种预测性维护框架,通过深度学习和不确定性估计来改进半导体制造中剩余使用寿命的估计,以降低维护成本。

0 人收藏 0 人点赞
#uncertainty-estimation

剖析多模态大语言模型中的免训练不确定性估计

arXiv cs.CL ↗ · 4天前 缓存

一项系统性的基准测试研究,对多模态大语言模型的免训练不确定性量化策略进行评测,将方法分为基于令牌级、语言化和语义的方法,并发现最佳策略取决于响应长度。

0 人收藏 0 人点赞
#uncertainty-estimation

小型语言模型知道自己不知道什么吗?

arXiv cs.CL ↗ · 5天前 缓存

本文评估了小型语言模型中基于熵的置信度信号,发现 semantic entropy 提供了一种可行的方法,通过选择性地路由到更大的模型,可将准确性提高多达50个百分点。

0 人收藏 0 人点赞
#uncertainty-estimation

注意力分散作为大型语言模型中幻觉的诊断信号

arXiv cs.CL ↗ · 2026-09-17 缓存

本文提出了一种基于注意力分散的无监督指标,用于检测大型语言模型中的幻觉,在使用Qwen2.5模型家族的数学推理基准测试中显示出显著的AUC提升。

0 人收藏 0 人点赞
#uncertainty-estimation

卡尔曼增量网络:不确定性感知的联想记忆

Hugging Face Daily Papers ↗ · 2026-09-07 缓存

介绍了卡尔曼增量网络,该网络通过将线性注意力重新表述为带有卡尔曼滤波更新的线性高斯状态空间模型来改进语言建模,以追踪记忆不确定性,从而产生比现有线性注意力模型性能更优的高效近似。

0 人收藏 0 人点赞
#uncertainty-estimation

从令牌到语义:利用互补信号在黑盒LLMs中检测幻觉

arXiv cs.CL ↗ · 2026-09-03 缓存

本文提出通过结合语义熵和令牌级不确定性信号来检测黑盒LLMs中的幻觉的方法,评估了TopK、CoCoA、Gated和Stacked等技术在多个基准测试中的表现,发现没有单一方法普遍最强,但Stacked通常表现最佳。

0 人收藏 0 人点赞
#uncertainty-estimation

纵向贝叶斯学习在阿尔茨海默病连续谱中的连续疾病定位

arXiv cs.LG ↗ · 2026-08-21 缓存

本文提出疾病连续谱定位(DCP),一个纵向贝叶斯学习框架,可连续估计阿尔茨海默病的严重程度,并提供不确定性感知的疾病进展预测评分。

0 人收藏 0 人点赞
#uncertainty-estimation

快速分叉:高效估计文本生成中的不确定性动态

arXiv cs.CL ↗ · 2026-08-21 缓存

本文提出一种统计模型,用于高效估计文本生成中的不确定性动态,平滑嘈杂的重采样数据,以在保持LLM推理链分析准确性的同时显著降低计算成本。

0 人收藏 0 人点赞
#uncertainty-estimation

领域偏移下的可靠金融命名实体识别

arXiv cs.CL ↗ · 2026-08-21 缓存

本文研究了领域偏移下金融命名实体识别的置信度估计和选择性预测,评估了BERT和LoRA微调的Qwen模型,以提高在不同输入分布(如SEC文件和社交媒体)下的可靠性。

0 人收藏 0 人点赞
#uncertainty-estimation

H$^2$EDL: 用于层次分类的超证据深度学习

arXiv cs.LG ↗ · 2026-08-20 缓存

本文提出H2EDL,一种用于层次分类的超证据深度学习模型,它能捕捉标签层次结构中多层次的不确定性,减少校准误差,并在细粒度识别任务中提高粗粒度类别的保留率。

0 人收藏 0 人点赞
#uncertainty-estimation

口头过度自信的多维度:一项可解释性研究

arXiv cs.CL ↗ · 2026-08-20 缓存

本可解释性研究通过分析不确定性如何通过口头标记、弃权和数值分数表达,聚焦于Qwen3-4B,考察了大型语言模型中的过度自信现象,并提出了识别和缓解过度自信错误的方法。

0 人收藏 0 人点赞
#uncertainty-estimation

一个可解码性准则预测在大型语言模型中隐藏状态选择何时优于多数投票

arXiv cs.AI ↗ · 2026-08-19 缓存

本文提出CASE,一种动态选择组合器,使用可解码性准则来预测在大型语言模型中隐藏状态选择何时优于多数投票,从而提高在困难问题上的可靠性。

0 人收藏 0 人点赞
#uncertainty-estimation

不确定性不足时:代码生成中自我纠正的实证研究

arXiv cs.AI ↗ · 2026-08-18 缓存

本文实证研究了使用不确定性估计方法进行代码生成中的自我纠正,发现基于不确定性的方法未能提高Pass@1准确率,而基于验证的方法则取得了显著增益。

0 人收藏 0 人点赞
#uncertainty-estimation

用于LLM辅助系统综述筛选的辅助不确定性信号:一项跨八项Cohen药物类别综述的基准研究

arXiv cs.CL ↗ · 2026-08-18 缓存

本文对基于BERT+GCN分类器的辅助不确定性信号进行基准测试,以提高LLM辅助系统综述筛选的效率。研究表明,针对性地仅路由MAYBE结果可在接近基线的成本下实现效率最大化。

0 人收藏 0 人点赞
#uncertainty-estimation

大型语言模型中的稳定校准错误:高置信度错误的实用视角

arXiv cs.AI ↗ · 2026-08-17 缓存

本文探讨大型语言模型中的稳定校准错误现象,即高置信度错误在微小扰动下局部保持稳定。通过审计分数和探测等诊断方法评估校准程度和内部敏感性。

0 人收藏 0 人点赞
#uncertainty-estimation

Fisher8: Stabilizing Neural Heteroscedastic Regression via Output-Layer Fisher Geometry

arXiv cs.LG ↗ · 2026-08-12 缓存

This paper introduces Fisher8, an output-layer gradient correction that uses Fisher geometry instead of Euclidean geometry to stabilize neural heteroscedastic regression, improving uncertainty calibration and likelihood-error tradeoffs.

0 人收藏 0 人点赞
#uncertainty-estimation

使用物理信息深度学习从显微图像预测钢材疲劳寿命

arXiv cs.LG ↗ · 2026-08-03 缓存

本文介绍了 FatigueCV,一个物理信息深度学习框架,可在65毫秒内从光学显微图像预测钢材疲劳寿命,使用带不确定性估计的CNN。在合成显微图像上的验证显示出强劲性能(R²=0.93),但现实世界验证被列为未来工作。

0 人收藏 0 人点赞
#uncertainty-estimation

使用悲观评论家的协作加权方法缓解离策略强化学习中的过估计

arXiv cs.LG ↗ · 2026-07-30 缓存

提出了一种协作加权演员-评论家(CWAC)框架,该框架使用分布式评论家和协作加权机制来缓解离策略强化学习中的过估计偏差。

0 人收藏 0 人点赞
#uncertainty-estimation

小型视觉-语言模型知道自己错了但说不出来:一项关于在现实图像退化下陈述信心与内部信心的双模型研究

arXiv cs.CL ↗ · 2026-07-27 缓存

本文评估了小型开源视觉-语言模型(Qwen2-VL-2B和SmolVLM)如何处理现实图像退化,发现它们口头表达的信心不可靠,而内部令牌概率提供了更好的错误检测能力,尽管两者在严重低光条件下均失败。

0 人收藏 0 人点赞
#uncertainty-estimation

贝叶斯不确定性估计提升医疗AI代理的临床决策能力

arXiv cs.LG ↗ · 2026-07-24 缓存

本文表明,蒙特卡洛丢弃法能够为胸部X光片分类器提供认知不确定性信号,当以二元错误风险标志的方式传达时,可改善临床决策支持代理的错误检测,并减少自信误诊。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈