标签
本文提出一个风险控制框架,用于在事实评估中将LLM作为判断器。该框架校准不确定性阈值以维持用户指定的错误率,并在必要时路由到检索增强模式,从而实现具有可证明可靠性保证的更高覆盖率。
The paper proposes Invertible Logits Transformation (InvLT), a post-hoc calibration method that applies a learnable scalar MLP element-wise to logits, preserving accuracy while correcting nonlinear miscalibration more flexibly than temperature scaling.
本文介绍了 Unscented KalmanNet (UKN),一种混合深度学习滤波器,它通过可学习组件增强无迹卡尔曼滤波器,在未知噪声统计和模型失配下提高状态估计精度和协方差校准。实验表明,与 UKF 和其他 KalmanNet 变体相比,RMSE 显著降低。
介绍了一种用于预测回归的高效贝叶斯深度集成方法,该方法结合了低维集成表示、闭式贝叶斯聚合和独立集成训练,以在保持计算效率的同时获得校准的不确定性估计。
SAGE 提出了一种群体级别的不确定性目标,该目标在采样响应上构建基于答案条件的不确定性几何结构,以改进大语言模型中的口头不确定性对齐,并引入了 GUPO 进行训练。跨推理任务的实验表明,不确定性排序得到改善,过度自信有所减少。
UNIQ引入了一种用于离线强化学习的共形校准方法,该方法基于不确定性对每个状态自适应调整保守性,在部分D4RL基准测试上优于IQL,同时保持内存效率。
UCCI提出了一种校准优先的路由器,用于LLM级联,它使用等渗回归将令牌级别的边际不确定性映射到错误概率,在生产级NER任务中实现了31%的成本降低,同时保持微F1=0.91,并将期望校准误差从0.12降至0.03。
本文介绍了 Agent-BRACE,该方法将大型语言模型(LLM)智能体解耦为信念状态模型和策略模型,以处理部分可观测环境中的长视距任务。通过语言化状态不确定性,该方法在保持上下文窗口大小恒定的同时,相比基线方法实现了显著的性能提升。
本文介绍了 BitCal-TTS,这是一种运行时控制器,通过在测试时扩展期间校准置信度信号,提高了量化推理模型的准确性并减少了过早终止的问题。