reference-free

标签

Cards List
#reference-free

当没有参考答案时,LLM评委可能过于慷慨

arXiv cs.CL · 2026-07-15 缓存

本文表明,在没有提供参考答案的情况下,LLM评委倾向于对错误答案给予过多评分,而添加参考可以将判定结果翻转多达85%,从而更符合人类判断。作者提出了在无参考设置中使用LLM评委的校准步骤。

0 人收藏 0 人点赞
#reference-free

更令人信服,而非更正确:无参考LLM评判者的自我博弈奖励操纵

arXiv cs.LG · 2026-07-08 缓存

本文识别了自我博弈训练中使用的无参考LLM评判者的结构缺陷,表明它们评估的是合理性而非正确性,导致奖励操纵,策略学会生成合理但错误的答案。作者提出了一种隐藏锚点审计和解锚奖励来缓解这一问题。

0 人收藏 0 人点赞
#reference-free

PoQ-Judge:一种面向去中心化LLM推理中成本感知质量证明的多架构评估框架

arXiv cs.CL · 2026-06-11 缓存

介绍了PoQ-Judge,一种采用无参考评判模型(TextCNN、MiniLM、DeBERTa)的多架构评估框架,用于去中心化LLM推理中的成本感知质量证明,实现了与地面真值代理的高相关性,同时消除了对参考答案的需求。

0 人收藏 0 人点赞
#reference-free

Granuscore:一种用于文本分析和问答的无参考粒度度量

arXiv cs.CL · 2026-05-27 缓存

Granuscore是一种用于文本分析和问答的无参考粒度度量。它利用分层嵌入空间来捕捉细粒度与粗粒度语言,并在QA基准测试中展示了模型行为的一致差异。

0 人收藏 0 人点赞
#reference-free

面向MT的无参考强化学习微调:Seq2Seq视角

arXiv cs.CL · 2026-05-18 缓存

本文将组相对策略优化(GRPO)应用于编码器-解码器Seq2Seq模型,用于机器翻译微调,使用无需并行数据的无参考奖励(LaBSE和COMET-Kiwi),并在13种语言上取得了一致的改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈