uncertainty-estimation

Tag

Cards List
#uncertainty-estimation

Kalman Delta Networks: Uncertainty-aware Associative Memory

Hugging Face Daily Papers · 2d ago Cached

Introduces Kalman Delta Networks, which improve language modeling by reformulating linear attention as a linear-Gaussian state-space model with Kalman-filter updates to track memory uncertainty, yielding efficient approximations that outperform existing linear-attention models.

0 favorites 0 likes
#uncertainty-estimation

From Tokens to Semantics: Leveraging Complementary Signals for Hallucination Detection in Black-Box LLMs

arXiv cs.CL · 6d ago Cached

This paper proposes methods for detecting hallucinations in black-box LLMs by combining semantic entropy and token-level uncertainty signals, evaluating techniques like TopK, CoCoA, Gated, and Stacked across multiple benchmarks to find that no single method is universally strongest but Stacked often performs best.

0 favorites 0 likes
#uncertainty-estimation

Longitudinal Bayesian Learning of Continuous Disease Position across the Alzheimer's Disease Continuum

arXiv cs.LG · 2026-08-21 Cached

This paper introduces Disease Continuum Positioning (DCP), a longitudinal Bayesian learning framework that continuously estimates Alzheimer's disease severity from neuroimaging data, providing an uncertainty-aware score for disease progression prediction.

0 favorites 0 likes
#uncertainty-estimation

Forking Fast: Efficiently Estimating Uncertainty Dynamics in Text Generation

arXiv cs.CL · 2026-08-21 Cached

This paper proposes a statistical model to efficiently estimate uncertainty dynamics in text generation, smoothing noisy resampling data to significantly reduce computational costs while maintaining accuracy in analyzing LLM reasoning chains.

0 favorites 0 likes
#uncertainty-estimation

Reliable Financial Named Entity Recognition under Domain Shift

arXiv cs.CL · 2026-08-21 Cached

This paper studies confidence estimation and selective prediction for financial named entity recognition under domain shift, evaluating BERT and LoRA-tuned Qwen models to enhance reliability across different input distributions like SEC filings and social media.

0 favorites 0 likes
#uncertainty-estimation

H$^2$EDL: Hyper Evidential Deep Learning for Hierarchical Classification

arXiv cs.LG · 2026-08-20 Cached

The paper proposes H2EDL, a hyper evidential deep learning model for hierarchical classification that captures uncertainty at multiple levels of a label hierarchy, reducing calibration error and improving the preservation of coarse categories in fine-grained recognition tasks.

0 favorites 0 likes
#uncertainty-estimation

Different Facets of Verbalised Overconfidence: an Interpretability Study

arXiv cs.CL · 2026-08-20 Cached

This interpretability study examines overconfidence in large language models, focusing on Qwen3-4B, by analyzing how uncertainty is expressed through verbal markers, abstention, and numeric scores, and proposes methods to identify and mitigate overconfident errors.

0 favorites 0 likes
#uncertainty-estimation

A decodability criterion predicts when hidden-state selection beats majority voting in large language models

arXiv cs.AI · 2026-08-19 Cached

The paper proposes CASE, a dynamic selection combiner using a decodability criterion to predict when hidden-state selection outperforms majority voting in large language models, enhancing reliability on difficult questions.

0 favorites 0 likes
#uncertainty-estimation

When Uncertainty Isn't Enough: An Empirical Study of Self-Correction in Code Generation

arXiv cs.AI · 2026-08-18 Cached

The paper empirically studies self-correction in code generation using uncertainty estimation methods, finding that uncertainty-based approaches fail to improve Pass@1 accuracy, while verification-based methods yield significant gains.

0 favorites 0 likes
#uncertainty-estimation

Auxiliary uncertainty signals for LLM-assisted systematic review screening: a benchmark across eight Cohen drug-class reviews

arXiv cs.CL · 2026-08-18 Cached

This paper benchmarks auxiliary uncertainty signals from a BERT+GCN classifier to improve LLM-assisted systematic review screening, showing that targeted MAYBE-only routing maximizes efficiency with near-baseline cost.

0 favorites 0 likes
#uncertainty-estimation

Stable Miscalibration in Large Language Models: A Practical View of High-Confidence Errors

arXiv cs.AI · 2026-08-17 Cached

This paper studies stable miscalibration in large language models, where high-confidence errors remain locally stable under perturbations, using diagnostics like audit scores and probes to assess calibration and internal sensitivity.

0 favorites 0 likes
#uncertainty-estimation

Fisher8: Stabilizing Neural Heteroscedastic Regression via Output-Layer Fisher Geometry

arXiv cs.LG · 2026-08-12 Cached

This paper introduces Fisher8, an output-layer gradient correction that uses Fisher geometry instead of Euclidean geometry to stabilize neural heteroscedastic regression, improving uncertainty calibration and likelihood-error tradeoffs.

0 favorites 0 likes
#uncertainty-estimation

Predicting Steel Fatigue Life from Micrographs Using Physics-Informed Deep Learning

arXiv cs.LG · 2026-08-03 Cached

This paper introduces FatigueCV, a physics-informed deep learning framework that predicts steel fatigue life from optical micrographs in under 65ms, using a CNN with uncertainty estimation. Validation on synthetic micrographs shows strong performance (R²=0.93), though real-world validation is noted as future work.

0 favorites 0 likes
#uncertainty-estimation

Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning

arXiv cs.LG · 2026-07-30 Cached

Proposes Collaborative Weighting Actor-Critic (CWAC), a framework that uses distributional critics and a collaborative weighting mechanism to mitigate overestimation bias in off-policy reinforcement learning.

0 favorites 0 likes
#uncertainty-estimation

Small Vision-Language Models Know When They Are Wrong But Cannot Say So: A Two-Model Study of Stated versus Internal Confidence Under Realistic Image Degradation

arXiv cs.CL · 2026-07-27 Cached

This paper evaluates how small open-weight vision-language models (Qwen2-VL-2B and SmolVLM) handle realistic image degradations, finding that their verbalized confidence is unreliable while internal token probability provides much better error detection, though both fail under severe low-light conditions.

0 favorites 0 likes
#uncertainty-estimation

Bayesian uncertainty estimation improves clinical decision making in medical AI agents

arXiv cs.LG · 2026-07-24 Cached

This paper shows that Monte Carlo dropout provides epistemic uncertainty signals for chest radiograph classifiers, which improves error detection and reduces confident misdiagnoses in clinical decision-support agents when communicated as a binary error-risk flag.

0 favorites 0 likes
#uncertainty-estimation

Uncertainty-Aware Trust Estimation for Multi-LLM Systems via Structured Expert Judgement

arXiv cs.LG · 2026-07-24 Cached

This paper introduces an uncertainty-aware trust estimation method for aggregating predictions from multiple LLMs, adapting structured expert judgment with Cooke-style log weighting to penalize overconfident incorrect predictions. Evaluations on MMLU and MMLU-Pro show that this approach achieves superior accuracy-reliability balance under heterogeneous and contaminated expert panels.

0 favorites 0 likes
#uncertainty-estimation

Stochastic Sampling is Epistemically Shallow: The Dimensionality Gap Between Temperature Variation and Model Diversity in LLMs

arXiv cs.AI · 2026-07-24 Cached

This paper investigates whether stochastic sampling (self-consistency) in LLMs can capture cross-question structure similar to diverse ensembles. Using a Marchenko–Pastur test, the authors find that within a single model, stochastic variation yields at most one significant dimension, while an ensemble of 24 models yields four, revealing a dimensionality gap that limits self-consistency as an ensemble substitute.

0 favorites 0 likes
#uncertainty-estimation

From Critic to Confidence: PPO for Language-Based Quantitative Prediction with Confidence Estimation

arXiv cs.CL · 2026-07-15 Cached

The article introduces CARE-PPO, a reinforcement learning framework that integrates confidence estimation with PPO fine-tuning for language-based quantitative prediction, enabling models to produce both accurate numerical estimates and reliable confidence signals, demonstrated in healthcare and finance tasks.

0 favorites 0 likes
#uncertainty-estimation

Hallucination Detection in Large Language Models Using Diversion Decoding

arXiv cs.CL · 2026-07-14 Cached

This paper introduces diversion decoding, a novel method for detecting hallucinations in large language models by actively challenging model responses during the decoding phase to extract features for training an uncertainty heuristic, achieving superior performance with lower computational complexity.

0 favorites 0 likes
Next →
← Back to home

Submit Feedback