标签
本文评估了中文大型语言模型在源自搜索查询的事实问题上的谄媚性,发现反谄媚提示能减少信念对齐错误,但会增加不确定性,从而影响事实准确性。
本文提出一个风险控制框架,用于在事实评估中将LLM作为判断器。该框架校准不确定性阈值以维持用户指定的错误率,并在必要时路由到检索增强模式,从而实现具有可证明可靠性保证的更高覆盖率。