selective-prediction

标签

Cards List
#selective-prediction

一个分数,两个决策:在罕见疾病尾部的选择性预测

arXiv cs.LG · 2天前 缓存

本文分析了用于罕见疾病诊断的选择性预测系统,表明小型开源权重LLMs在超罕见疾病上召回率较低,并探讨了使用分数边际进行决策的局限性。

0 人收藏 0 人点赞
#selective-prediction

文档抽取中基于字段的选择性风险控制:三种失效模式、一个有效性阶梯及其有效条件

arXiv cs.LG · 2天前 缓存

本文剖析了文档抽取系统中基于字段的选择性风险控制的三种失效模式,并提出一个由低到高的有效性阶梯式修复方案,通过使用前沿AI模型在真实数据上的实验证明了其改进效果。

0 人收藏 0 人点赞
#selective-prediction

可靠性感知的性别歧视检测:结合DPO与标注者一致性及词元级置信度评分

arXiv cs.CL · 6天前 缓存

本文介绍了RA-DPO,一种可靠性感知的直接偏好优化方法,将标注者一致性、模型置信度和词元级不确定性相结合用于性别歧视检测,提高了训练效率并支持选择性预测。

0 人收藏 0 人点赞
#selective-prediction

选择性问答中的渐近风险校准

arXiv cs.CL · 2026-08-13 缓存

本文提出了 A-CRC-QA,一种用于选择性问答的事后校准框架,通过渐近风险校准控制已接受答案中的错误率,并在 CoQA 和 MedMCQA 上展示了更好的可靠性与保留率之间的权衡。

0 人收藏 0 人点赞
#selective-prediction

超越单轮置信度:面向LLM智能体的轨迹自适应不确定性量化

arXiv cs.CL · 2026-08-13 缓存

本文研究单轮不确定性量化方法是否能迁移到交互式LLM智能体轨迹中,在五个LLM和四个工具使用数据集上评估了白盒、黑盒和反思型评分器。结果表明迁移效果参差不齐,黑盒自洽性通常最强,并建议在轨迹层面重新验证UQ方法。

0 人收藏 0 人点赞
#selective-prediction

图表与文档理解中金融视觉语言模型的置信度估计

arXiv cs.CL · 2026-08-10 缓存

本文研究金融视觉语言模型在图表与文档理解中的置信度估计,评估了五种LVLM上的七种估计器。研究发现,稀缺的属性是校准而非排序,只有经过训练的探针才能产生可设阈值的分数,从而安全地将任务转交给人工审核。

0 人收藏 0 人点赞
#selective-prediction

施工文档中基于证据的约束检查

arXiv cs.AI · 2026-08-03 缓存

提出了一种用于施工文档约束检查的基于证据的流水线,评估了在专家参考任务中PDF证据分配的分辨率-广度权衡。

0 人收藏 0 人点赞
#selective-prediction

基于证据链评估的校准式选择性事实核查

arXiv cs.AI · 2026-07-22 缓存

本文介绍了一种名为证据链评估(ECE)的选择性事实核查框架,该框架允许基于LLM的验证代理在证据薄弱、稀疏或不一致时放弃给出判断。在ECE-Bench上,ECE实现了93.7%覆盖率下的97.8%选择性准确率,展示了处理认知薄弱证据时面向安全性的权衡。

0 人收藏 0 人点赞
#selective-prediction

超越输出空间校准:时间序列分类中选择性可靠性估计的频谱证据捆绑

arXiv cs.LG · 2026-07-22 缓存

本文介绍SEB-Cal,一种通过频谱特征(频带能量、熵、峰值主导性、相位稳定性)增强输出空间校准的方法,以改善时间序列分类中的选择性可靠性估计,在多个数据集上实现更高的Corr-AUROC和更低的[email protected]

0 人收藏 0 人点赞
#selective-prediction

文本到SQL正确性的预测因素:一项选择性预测研究

arXiv cs.LG · 2026-07-09 缓存

本文研究了在选择性预测中哪些信号最能预测文本转SQL的正确性。研究发现,来自LLM判断器的基于验证的信号优于黑盒统计信号(如自一致性),并且双提供者集成模型实现了0.82的AUROC,同时具有良好校准的概率。

0 人收藏 0 人点赞
#selective-prediction

保形风险控制何时能为LLM输出提供认证?界限、不可能性与结构化生成的适应性

arXiv cs.LG · 2026-06-30 缓存

本文刻画了保形风险控制何时能为结构化LLM输出提供认证,证明了不可能性界限,并分析了不同界限下的认证层次。在六个开放权重模型上的实证验证表明,困难配置在低风险水平下无法被认证,但在放宽目标下可实现实际认证。

0 人收藏 0 人点赞
#selective-prediction

超越Logprobs:一种基于多信号的LLM文档字段提取置信度引擎

arXiv cs.CL · 2026-06-24 缓存

ExtractConf是一种用于基于LLM的文档字段提取的置信度估计方法,它通过两种结构不同的调用(字段引导和文档引导)来推导不一致信号,在DocILE发票数据集上实现了0.928的ROC AUC,并为高风险自动化场景提供了可靠的选择性预测能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈