标签
本文提出了一种预测性维护框架,通过深度学习和不确定性估计来改进半导体制造中剩余使用寿命的估计,以降低维护成本。
一项系统性的基准测试研究,对多模态大语言模型的免训练不确定性量化策略进行评测,将方法分为基于令牌级、语言化和语义的方法,并发现最佳策略取决于响应长度。
本文评估了小型语言模型中基于熵的置信度信号,发现 semantic entropy 提供了一种可行的方法,通过选择性地路由到更大的模型,可将准确性提高多达50个百分点。
本文提出了一种基于注意力分散的无监督指标,用于检测大型语言模型中的幻觉,在使用Qwen2.5模型家族的数学推理基准测试中显示出显著的AUC提升。
介绍了卡尔曼增量网络,该网络通过将线性注意力重新表述为带有卡尔曼滤波更新的线性高斯状态空间模型来改进语言建模,以追踪记忆不确定性,从而产生比现有线性注意力模型性能更优的高效近似。
本文提出通过结合语义熵和令牌级不确定性信号来检测黑盒LLMs中的幻觉的方法,评估了TopK、CoCoA、Gated和Stacked等技术在多个基准测试中的表现,发现没有单一方法普遍最强,但Stacked通常表现最佳。
本文提出疾病连续谱定位(DCP),一个纵向贝叶斯学习框架,可连续估计阿尔茨海默病的严重程度,并提供不确定性感知的疾病进展预测评分。
本文提出一种统计模型,用于高效估计文本生成中的不确定性动态,平滑嘈杂的重采样数据,以在保持LLM推理链分析准确性的同时显著降低计算成本。
本文研究了领域偏移下金融命名实体识别的置信度估计和选择性预测,评估了BERT和LoRA微调的Qwen模型,以提高在不同输入分布(如SEC文件和社交媒体)下的可靠性。
本文提出H2EDL,一种用于层次分类的超证据深度学习模型,它能捕捉标签层次结构中多层次的不确定性,减少校准误差,并在细粒度识别任务中提高粗粒度类别的保留率。
本可解释性研究通过分析不确定性如何通过口头标记、弃权和数值分数表达,聚焦于Qwen3-4B,考察了大型语言模型中的过度自信现象,并提出了识别和缓解过度自信错误的方法。
本文提出CASE,一种动态选择组合器,使用可解码性准则来预测在大型语言模型中隐藏状态选择何时优于多数投票,从而提高在困难问题上的可靠性。
本文实证研究了使用不确定性估计方法进行代码生成中的自我纠正,发现基于不确定性的方法未能提高Pass@1准确率,而基于验证的方法则取得了显著增益。
本文对基于BERT+GCN分类器的辅助不确定性信号进行基准测试,以提高LLM辅助系统综述筛选的效率。研究表明,针对性地仅路由MAYBE结果可在接近基线的成本下实现效率最大化。
本文探讨大型语言模型中的稳定校准错误现象,即高置信度错误在微小扰动下局部保持稳定。通过审计分数和探测等诊断方法评估校准程度和内部敏感性。
This paper introduces Fisher8, an output-layer gradient correction that uses Fisher geometry instead of Euclidean geometry to stabilize neural heteroscedastic regression, improving uncertainty calibration and likelihood-error tradeoffs.
本文介绍了 FatigueCV,一个物理信息深度学习框架,可在65毫秒内从光学显微图像预测钢材疲劳寿命,使用带不确定性估计的CNN。在合成显微图像上的验证显示出强劲性能(R²=0.93),但现实世界验证被列为未来工作。
提出了一种协作加权演员-评论家(CWAC)框架,该框架使用分布式评论家和协作加权机制来缓解离策略强化学习中的过估计偏差。
本文评估了小型开源视觉-语言模型(Qwen2-VL-2B和SmolVLM)如何处理现实图像退化,发现它们口头表达的信心不可靠,而内部令牌概率提供了更好的错误检测能力,尽管两者在严重低光条件下均失败。
本文表明,蒙特卡洛丢弃法能够为胸部X光片分类器提供认知不确定性信号,当以二元错误风险标志的方式传达时,可改善临床决策支持代理的错误检测,并减少自信误诊。