标签
本文介绍了CW-BASS v2,一种用于半监督语义分割的饱和度感知伪标签选择方法,该方法根据教师的可靠性在严格过滤和自适应置信度下限之间自适应切换。使用DINOv2教师,在多个基准测试上显示了优于基线的结果。
本文提出CalibDCD,一种用于基于特征的LLM数据污染检测的校准框架,可缓解后训练引起的特征偏移,检测性能最高提升7.0% AUC和15.0% TPR@5%FPR。
MARCO is a Meta AI framework that decomposes clicks by intent to improve ads conversion prediction, correcting per-intent calibration bias and lifting conversions per click by +2.80% and topline metrics by +0.98% in production.
本文识别出扩散语言模型中的“表征置信度差距”:内部状态能准确检测输入噪声,但报告的置信度在高噪声下仍保持高位,答案排序能力下降。本文引入了一种轻量级、无需训练的信息提取工具,利用隐藏状态改进排序,而无需修改基础模型。
This paper empirically studies token-probability-based confidence estimation and calibration for LLMs in mathematical question answering, comparing single-pass and multi-pass estimators and evaluating post-hoc calibration methods.
Ask-E 是一个新的基准测试和训练环境,用于评估和训练模型生成针对特定技能水平校准的问题,该技能水平由两个现有语言模型的能力定义。前沿模型在校准上的得分低于 50%,而在 Ask-E 上进行训练可以提高下游数学基准测试的成绩,且无需新的数学数据或基于正确性的奖励。
本文介绍了一种简单的基于 Dirichlet 的预测器,它实现了最优的同步多类 U 校准率,弥补了有界真损失遗憾界中已知的维度差距,并消除了光滑损失的额外加性项。
本文研究金融视觉语言模型在图表与文档理解中的置信度估计,评估了五种LVLM上的七种估计器。研究发现,稀缺的属性是校准而非排序,只有经过训练的探针才能产生可设阈值的分数,从而安全地将任务转交给人工审核。
本文提出了一种新方法,通过让 LLM 随机生成数字来测量其潜在的数字偏差,并据此修正 token 生成概率,从而缓解 LLM-as-a-Judge 中的评分偏差。在四个任务上的实验表明,该方法优于基线方法,并揭示了评分偏差在不同模型、任务和分数区间上的差异。
This paper studies the sample complexity of multicalibration for a sequence of properties that are sequentially identifiable, establishing matching upper and lower bounds up to logarithmic factors.
本文表明,大语言模型表面上的自我纠正增益往往源于格式修复,而非推理能力的提升。在多种模型规模下,格式效应主导内容效应,且在能力较强的模型上内容边际接近零,这表明该领域将少数实测的自我纠正误归因于实际的内容改进。
The paper introduces DUD (Decoupled Update Dynamics), a framework that separates Feed-Forward Network and Attention contributions via causal interventions to improve uncertainty quantification and calibration in large language models, outperforming state-of-the-art baselines.
作者评论 FutureX 预测评测框架,指出其只对最终答案评分,无法区分概率校准质量,并探讨 Brier score 与 log loss 等更细粒度的评估方式。
本文首次系统性地研究了未见亚型偏移下的校准问题,表明模型在已知粗粒度类别内的新亚型上会变得过度自信,并主张亚型鲁棒性应通过校准指标而非仅凭准确性来评估。
本文表明,知识蒸馏对小型语言模型中的偏见具有非对称影响:在无歧义任务上,它提升了上下文遵循能力,但在有歧义任务上却损害了拒答校准;并提出了PCCD,一种用于诊断聚合指标遗漏的逐项损害的协议。
Introduces CALCoDe, a post-hoc reliability layer for frozen medical vision-language models that mitigates class-tail undercoverage under clinical shift, achieving strong worst-class accepted coverage across multiple dermatology shifts and VLM backbones.
Introduces a montage-agnostic encoder for calibration-light cross-user gesture recognition from surface EMG, using shared weights and electrode coordinates to handle variable channel counts and reduce per-user calibration. It outperforms per-user baselines on some datasets and analyzes factors affecting cross-user transfer.
本文介绍了Value-Router,一项针对推荐系统中廉价启发式方法与昂贵LLM调用之间成本感知路由的仿真研究,表明价值加权路由提高了精确度,并通过自适应预算处理季节性需求激增。
一位开发者构建了一个测试框架,在量化过程中测量每个权重组的 KL 散度,从而生成了 Qwen3.6-27B 的三个定制量化版本(Bedrock、Tightrope、Gambit),实现了优化的压缩。工具调用被确定为量化下最早退化的能力。
NVIDIA 发布了 Ising Calibration 1.5,这是一个开源视觉语言模型,通过增强的上下文学习和改进的性能实现量子计算机的完全自动化校准,现在可以部署在单个 GPU 上。