factual-evaluation

标签

Cards List
#factual-evaluation

评估中文大型语言模型在基于在线搜索查询的事实问题上的谄媚性

arXiv cs.CL ↗ · 3天前 缓存

本文评估了中文大型语言模型在源自搜索查询的事实问题上的谄媚性,发现反谄媚提示能减少信念对齐错误,但会增加不确定性,从而影响事实准确性。

0 人收藏 0 人点赞
#factual-evaluation

判断、检索或放弃:具有可证明风险保证的不确定性防护LLM判断

arXiv cs.CL ↗ · 2026-08-19 缓存

本文提出一个风险控制框架,用于在事实评估中将LLM作为判断器。该框架校准不确定性阈值以维持用户指定的错误率,并在必要时路由到检索增强模式,从而实现具有可证明可靠性保证的更高覆盖率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈