标签
本文介绍了CalBrief——一个包含16个证据包和96个人工验证结论的试点诊断基准,用于评估大型语言模型是否能够生成证据校准的科学简报。研究发现,结构化组织能提升推理能力,但显式的强度校准策略过于保守,且这种保守性主要源于标签空间的扩展,而非信号注入。
介绍StatefulDiscovery,一个用于开放端科学发现的框架,它利用外部化的调查状态来校准证据和主张,在生成得到充分支持的高价值主张方面优于基线方法。
本文介绍了ECC算法,该算法通过有限模型比较校准语义嵌入,根据潜在能力需求对查询进行聚类,将LLM能力排名质量相较于基线提高了超过17个百分点。