evidence-calibration

Tag

Cards List
#evidence-calibration

CalBrief: A Pilot Diagnostic Benchmark for Evidence-Calibrated Scientific Briefing with Large Language Models

arXiv cs.CL · 2026-06-29 Cached

The paper presents CalBrief, a pilot diagnostic benchmark of 16 evidence packages and 96 human-verified takeaways for evaluating whether large language models can generate evidence-calibrated scientific briefings. The study finds that structured organization improves reasoning but explicit strength-calibration policies are overly conservative, with most conservatism arising from expanded label spaces rather than signal injection.

0 favorites 0 likes
#evidence-calibration

StatefulDiscovery: Evidence-Calibrated Claim Formation in Open-Ended Scientific Discovery

arXiv cs.AI · 2026-06-11 Cached

Introduces StatefulDiscovery, a framework for open-ended scientific discovery that uses externalized investigation state to calibrate evidence and claims, outperforming baselines in producing well-supported high-value claims.

0 favorites 0 likes
#evidence-calibration

Capturing LLM Capabilities via Evidence-Calibrated Query Clustering

arXiv cs.AI · 2026-05-19 Cached

This paper introduces ECC, an algorithm that calibrates semantic embeddings with limited model comparisons to cluster queries by latent capability requirements, improving LLM capability ranking quality by over 17 percentage points over baselines.

0 favorites 0 likes
← Back to home

Submit Feedback