标签
本文提出了一项基准测试,用于评估大语言模型法官在AI生成的临床笔记中检测遗漏信息的能力。研究发现,标准法官模型在识别遗漏方面存在困难,但将任务重构为基于事实的验证可显著提升检测效果。
SAGE是一种新颖的任务导向对话智能体评估框架,它将评估基于对话状态变化,并使用弃权机制来提供成本效益高、准确的回合级判断,无需昂贵的LLM调用。
本文通过基于社区的评估,研究了AI生成的多模态故事在五个非洲社区中的文化契合度,发展了一种错位分类法,并评估了自动化评判的可靠性。
JuryProbe提出了一种经验性诊断工具,用于评估无参考LLM判断面板在事实核查中的共识风险,并采用基于校准的路由策略,利用可信参考对高风险决策进行验证,从而降低误接受率。
Primordial AI的Will Brown在此次演讲中探讨了如何将强化学习扩展至奖励难以验证的复杂现实任务,涉及锚定法、大语言模型评判与仿真模拟等技术。
Alexander Yue 推出了一项新的浏览器使用基准测试,其中 Opus 5 和 GPT-5.6 Sol 表现相似,强调了基准测试的稳健设计,包括为大语言模型评委提供的经过验证的评分标准。
本文提出了EvalCEGAR方法,该方法利用一组Python运算符池自动进化评估指标,能标记AI输出中的特定缺陷,相比手写运算符和LLM评判者提高了准确性。
本文研究了由自我与他者标签在LLM评审中引发的双向偏见,表明仅标签就能改变评估分数,无论实际来源如何,这对理解作者归属和受控评估任务有贡献。
本文解决了LLM评判器在同时评估多个评分标准时遇到的评分标准干扰问题,并提出了自锚定评分标准对齐(SARA)方法,通过在策略自蒸馏来提高评估一致性。
本文介绍了 Wiggle 框架,这是一种针对 LLM 裁判认识论稳定性的统一压力测试,涵盖 14 项任务,衡量机械一致性、单轮信念与多轮持久性。研究发现,所有 9 个受研究的前沿模型在压力下都会大幅翻转判决,且成功的压力通常相对于基准真相而言具有净破坏性。
本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。
本文介绍了 MobileJudgeBench,一个包含 931 条人工标注轨迹的基准,用于系统评估移动智能体任务中基于 LLM 的评判器。研究发现,带有采样屏幕截图的简单基线评判器可与专用方法相媲美甚至更优,而 LLM 主干是质量的主要驱动因素。
一条推文讨论了一个发现的怪现象:将论文PDF重命名为更长、更积极的标题会提高LLM评审的评分,建议谨慎使用基于评分的LLM评估,并推荐改用二分类标签。
本文来自石溪大学,识别了文本摘要人类忠实性标注中的“平均偏差”:全局人类标签与逐句LLM判断的平均值之间的相关性,优于与严格合取规则的相关性,这意味着即使摘要包含局部事实错误,人类也常常将其标注为忠实。
A research paper introducing Chain-of-Models (CoM), an automated pipeline where a second LLM audits a first model's reasoning trace to correct cognitive biases. It finds that auditor effectiveness depends on model family and bias type, and proposes a bias-specific auditor selection rule that improves judgment accuracy.
一份六步指南,教你构建评估门控,让AI代理自主合并变更,涵盖评判偏差、运行时评估、轨迹评分等内容。
本文表明,在没有提供参考答案的情况下,LLM评委倾向于对错误答案给予过多评分,而添加参考可以将判定结果翻转多达85%,从而更符合人类判断。作者提出了在无参考设置中使用LLM评委的校准步骤。
Parlance Labs的一篇博客文章在真实生产数据上测试了自动化AI评估工具(Braintrust Loop、Arize Alyx、LangSmith Engine),发现它们能捕获人类标记的87%的问题,但会遗漏领域特定的失败案例并引入噪音,建议采用迭代式人机协同使用。
Prime Intellect工程师演示了一种方法,通过开放互联网使用分布式强化学习在30分钟内训练推理模型,利用Prime-RL、LLM评判器和多云GPU,使开放模型无需拥有数据中心即可与封闭实验室竞争。