llm-as-judge-reliability

标签

Cards List
#llm-as-judge-reliability

代理科学合成中引用忠实性的评估与防护

arXiv cs.AI · 2026-07-24 缓存

本文评估了代理科学合成系统中的引用忠实性,表明当前验证器的不可靠性,无支持引用率根据严格程度在3%到18%之间变化。它提出了一种以黄金标准锚定的评估协议和一个可部署的保护机制,该机制使用分裂共形预测为真正无支持的引用提供无分布界限。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈