evidence-calibration

标签

Cards List
#evidence-calibration

CalBrief:大型语言模型证据校准式科学简报的试点诊断基准

arXiv cs.CL · 2026-06-29 缓存

本文介绍了CalBrief——一个包含16个证据包和96个人工验证结论的试点诊断基准,用于评估大型语言模型是否能够生成证据校准的科学简报。研究发现,结构化组织能提升推理能力,但显式的强度校准策略过于保守,且这种保守性主要源于标签空间的扩展,而非信号注入。

0 人收藏 0 人点赞
#evidence-calibration

StatefulDiscovery: 开放端科学发现中基于证据校准的主张形成

arXiv cs.AI · 2026-06-11 缓存

介绍StatefulDiscovery,一个用于开放端科学发现的框架,它利用外部化的调查状态来校准证据和主张,在生成得到充分支持的高价值主张方面优于基线方法。

0 人收藏 0 人点赞
#evidence-calibration

通过证据校准的查询聚类捕捉LLM能力

arXiv cs.AI · 2026-05-19 缓存

本文介绍了ECC算法,该算法通过有限模型比较校准语义嵌入,根据潜在能力需求对查询进行聚类,将LLM能力排名质量相较于基线提高了超过17个百分点。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈