calibration

标签

Cards List
#calibration

你确定你确定吗?论指令微调对置信度与词汇多样性的影响

Hugging Face Daily Papers · 昨天 缓存

本文研究指令微调如何影响问答任务中的模型置信度与词汇多样性,发现指令微调会改变置信度并降低推理多样性,但并未改善校准性能。

0 人收藏 0 人点赞
#calibration

CW-BASS v2:基础模型教师下用于半监督分割的饱和度感知伪标签选择

Hugging Face Daily Papers · 昨天 缓存

本文介绍了CW-BASS v2,一种用于半监督语义分割的饱和度感知伪标签选择方法,该方法根据教师的可靠性在严格过滤和自适应置信度下限之间自适应切换。使用DINOv2教师,在多个基准测试上显示了优于基线的结果。

0 人收藏 0 人点赞
#calibration

面向LLM数据污染检测的后训练特征偏移校准

arXiv cs.CL · 2天前 缓存

本文提出CalibDCD,一种用于基于特征的LLM数据污染检测的校准框架,可缓解后训练引起的特征偏移,检测性能最高提升7.0% AUC和15.0% TPR@5%FPR。

0 人收藏 0 人点赞
#calibration

MARCO: Click-Intent Decomposition for Calibrated Ads Conversion Prediction

arXiv cs.LG · 2天前 缓存

MARCO is a Meta AI framework that decomposes clicks by intent to improve ads conversion prediction, correcting per-intent calibration bias and lifting conversions per click by +2.80% and topline metrics by +0.98% in production.

0 人收藏 0 人点赞
#calibration

不确定但确信:揭示扩散语言模型中的表征-置信度差距

arXiv cs.CL · 3天前 缓存

本文识别出扩散语言模型中的“表征置信度差距”:内部状态能准确检测输入噪声,但报告的置信度在高噪声下仍保持高位,答案排序能力下降。本文引入了一种轻量级、无需训练的信息提取工具,利用隐藏状态改进排序,而无需修改基础模型。

0 人收藏 0 人点赞
#calibration

From token probabilities to calibrated confidence: An empirical study of mathematical question answering

arXiv cs.LG · 3天前 缓存

This paper empirically studies token-probability-based confidence estimation and calibration for LLMs in mathematical question answering, comparing single-pass and multi-pass estimators and evaluating post-hoc calibration methods.

0 人收藏 0 人点赞
#calibration

Ask-E:一个用于校准问题生成的环境

arXiv cs.CL · 4天前 缓存

Ask-E 是一个新的基准测试和训练环境,用于评估和训练模型生成针对特定技能水平校准的问题,该技能水平由两个现有语言模型的能力定义。前沿模型在校准上的得分低于 50%,而在 Ask-E 上进行训练可以提高下游数学基准测试的成绩,且无需新的数学数据或基于正确性的奖励。

0 人收藏 0 人点赞
#calibration

Dirichlet Follow-the-Leader 弥合了同步多类 U 校准中的差距

arXiv cs.LG · 4天前 缓存

本文介绍了一种简单的基于 Dirichlet 的预测器,它实现了最优的同步多类 U 校准率,弥补了有界真损失遗憾界中已知的维度差距,并消除了光滑损失的额外加性项。

0 人收藏 0 人点赞
#calibration

图表与文档理解中金融视觉语言模型的置信度估计

arXiv cs.CL · 4天前 缓存

本文研究金融视觉语言模型在图表与文档理解中的置信度估计,评估了五种LVLM上的七种估计器。研究发现,稀缺的属性是校准而非排序,只有经过训练的探针才能产生可设阈值的分数,从而安全地将任务转交给人工审核。

0 人收藏 0 人点赞
#calibration

通过随机数生成缓解 LLM-as-a-Judge 中的评分偏差

arXiv cs.CL · 2026-08-07 缓存

本文提出了一种新方法,通过让 LLM 随机生成数字来测量其潜在的数字偏差,并据此修正 token 生成概率,从而缓解 LLM-as-a-Judge 中的评分偏差。在四个任务上的实验表明,该方法优于基线方法,并揭示了评分偏差在不同模型、任务和分数区间上的差异。

0 人收藏 0 人点赞
#calibration

Sample Complexity of Multicalibration for Multilevel Properties

arXiv cs.LG · 2026-08-06 缓存

This paper studies the sample complexity of multicalibration for a sequence of properties that are sequentially identifiable, establishing matching upper and lower bounds up to logarithmic factors.

0 人收藏 0 人点赞
#calibration

校准下限:格式修复可在中小规模下伪装成自我纠正

arXiv cs.CL · 2026-08-06 缓存

本文表明,大语言模型表面上的自我纠正增益往往源于格式修复,而非推理能力的提升。在多种模型规模下,格式效应主导内容效应,且在能力较强的模型上内容边际接近零,这表明该领域将少数实测的自我纠正误归因于实际的内容改进。

0 人收藏 0 人点赞
#calibration

DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models

arXiv cs.CL · 2026-08-05 缓存

The paper introduces DUD (Decoupled Update Dynamics), a framework that separates Feed-Forward Network and Attention contributions via causal interventions to improve uncertainty quantification and calibration in large language models, outperforming state-of-the-art baselines.

0 人收藏 0 人点赞
#calibration

@chengyongru: 一个 agent 认为 A 有 51%概率发生, 另一个认为有 99%. 但只要它们最后都提交 A, 在 FutureX 的单选题里, 答对都是 1 分, 答错都是 0 分. 仔细读完 FutureX 论文后, 这个例子一直留在我脑子里.…

X AI KOLs Timeline · 2026-08-04 缓存

作者评论 FutureX 预测评测框架,指出其只对最终答案评分,无法区分概率校准质量,并探讨 Brier score 与 log loss 等更细粒度的评估方式。

0 人收藏 0 人点赞
#calibration

亚型鲁棒性不仅仅是准确性:未见亚型偏移下的校准

arXiv cs.LG · 2026-08-04 缓存

本文首次系统性地研究了未见亚型偏移下的校准问题,表明模型在已知粗粒度类别内的新亚型上会变得过度自信,并主张亚型鲁棒性应通过校准指标而非仅凭准确性来评估。

0 人收藏 0 人点赞
#calibration

知识蒸馏对小型语言模型偏见的非对称影响

arXiv cs.CL · 2026-08-03 缓存

本文表明,知识蒸馏对小型语言模型中的偏见具有非对称影响:在无歧义任务上,它提升了上下文遵循能力,但在有歧义任务上却损害了拒答校准;并提出了PCCD,一种用于诊断聚合指标遗漏的逐项损害的协议。

0 人收藏 0 人点赞
#calibration

Mitigating Class-Tail Undercoverage in Medical Vision-Language Models under Clinical Shift

arXiv cs.LG · 2026-08-03 缓存

Introduces CALCoDe, a post-hoc reliability layer for frozen medical vision-language models that mitigates class-tail undercoverage under clinical shift, achieving strong worst-class accepted coverage across multiple dermatology shifts and VLM backbones.

0 人收藏 0 人点赞
#calibration

A Montage-Agnostic Encoder for Calibration-Light Cross-User Gesture Recognition from Surface Electromyography

arXiv cs.LG · 2026-07-31 缓存

Introduces a montage-agnostic encoder for calibration-light cross-user gesture recognition from surface EMG, using shared weights and electrode coordinates to handle variable channel counts and reduce per-user calibration. It outperforms per-user baselines on some datasets and analyzes factors affecting cross-user transfer.

0 人收藏 0 人点赞
#calibration

推荐系统应多久调用一次LLM?价值加权路由、监控与季节性鲁棒性

arXiv cs.AI · 2026-07-29 缓存

本文介绍了Value-Router,一项针对推荐系统中廉价启发式方法与昂贵LLM调用之间成本感知路由的仿真研究,表明价值加权路由提高了精确度,并通过自适应预算处理季节性需求激增。

0 人收藏 0 人点赞
#calibration

我构建了一个工具,在量化前实际测试哪些权重重要,而不是靠猜测(Qwen3.6-27B,三个版本:Bedrock/Tightrope/Gambit)

Reddit r/LocalLLaMA · 2026-07-28

一位开发者构建了一个测试框架,在量化过程中测量每个权重组的 KL 散度,从而生成了 Qwen3.6-27B 的三个定制量化版本(Bedrock、Tightrope、Gambit),实现了优化的压缩。工具调用被确定为量化下最早退化的能力。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈