标签
本文引入了一种使用失败空间分析的特定于事实性的标注策略,以在有限的标注预算下改善针对大语言模型的人类锚定事实性评估,并在基准系统上取得了显著的效率提升。
本文介绍了TriQua,一个用于LLM事实性评估的框架,它自适应地将事实表示为三元组或带有上下文限定符的超关系事实,并提出了TriQuaScore用于细粒度的事实性评分。实验表明,TriQua与人工标注结果高度一致,并且在基于证据的验证方面优于现有方法。