标签
本文介绍了ClaimProbe,一个用于检测深度研究报告中幻觉和错误归因的声明级审计框架,以及ClaimWriter,一个分层写作者,可将幻觉减少高达4.5倍,同时提高事实召回率。
本文形式化了AI评估制品的主张重放层,并对评估单元进行普查,发现大多数单元在确定性推断前停止,原因在于缺失历史证据或语义基础。