标签
该论文从心理测量学视角评估 LLM-as-a-Judge,使用 Many-Facet Rasch 模型将评分分解为潜在质量、评分者严苛度与残差难度,发现人类与 LLM 在汇总对齐之外仍存在明显的残差难度结构错配。
# AI Evals 工程师必做的 15 个实战项目 一位从业者梳理了 15 个 AI Evals 工程师必建的项目,涵盖以下方向: 1. 轨迹评分(trajectory grading) 2. 影子路由(shadow routing) 3. 带校准的 LLM-as-a-Judge 4. CI/CD 回归门禁 5. 对抗性 RAG 测试 6. DPO 微调飞轮 7. 统计显著性 8. Agent 红队测试 9. 漂移监控 10. 成本-质量看板 11. 反事实回放调试(counterfactual replay debugging) 12. 合成边缘用例生成 13. 上下文窗口淘汰测试(context-window eviction tests) 14. 数据集污染检查 15. 公开评测方法论拆解(public eval methodology teardowns)
BAER引入了一种骨干自适应证据路由方法,用于鲁棒的成对LLM评判,通过根据条件动态选择证据机制,在多个基准测试中实现了更高的准确性。
本文介绍Cargo框架,用于评估智能体AI系统。该框架通过将事实判断基于实时上下文并基于检索置信度对评估进行门控,以解决参考实例分歧问题,并引入用于基准测试的Cargo-Bench。
本文介绍了JEV-as-a-Judge,这是一种用于大型语言模型(LLMs)的经济高效评估方法,它使用一个仅基于决策的评判器,设置置信度阈值来接受确定的判定并上报不确定的判定,以显著更低的成本实现了与最先进模型相当的准确性。
本研究探讨了从去识别化简历中移除语言字段是否能防止LLM偏差审计中的人口统计泄露,发现非语言文本仍允许推断,且评估设计对结果有显著影响。
研究调查了LLM-as-a-Judge评估者是否能可靠地评估LLM生成故事的心理深度,揭示了人类偏好的异质性,而评判者则基于表层特征对推理输出表现出偏见。
本文研究文本表面噪声如何影响LLM评判者的偏见测量,发现噪声会系统性地高估偏见,尤其是在公平关键类别中,并引入了Fable基准来研究这一问题。
一个关于使用编码代理与 LangSmith CLI 来设置在线 LLM-as-a-judge 以评估 LLM 追踪的教程,所有配置都可从终端进行。
本文提出一种用于药物发现代理AI的LLM-as-a-Judge评估框架,通过专家标注者的人类对齐研究验证。优化法官模型以提升与人类判断的契合度,并为科学领域可重用评估提供洞见。
本文提出了一个在Netflix使用大语言模型作为评判者来评估推荐解释的生命周期框架,涵盖从开发到部署和监控的各个阶段,并通过A/B测试取得了积极结果,显示用户参与度得到提升。
本文提出了一种新方法,通过让 LLM 随机生成数字来测量其潜在的数字偏差,并据此修正 token 生成概率,从而缓解 LLM-as-a-Judge 中的评分偏差。在四个任务上的实验表明,该方法优于基线方法,并揭示了评分偏差在不同模型、任务和分数区间上的差异。
本文介绍了SysAdmin基准,该基准将前沿语言模型置于高保真Linux沙箱中扮演自主系统管理员角色,以衡量其权力寻求倾向。在2800个任务中,作者发现自发权力寻求行为极少(偏差校正后为0-5%),但识别出其他故障模式,如规格游戏和对目标修改的抵抗。
本教程演示了如何使用基于规则的检查和LLM-as-a-judge来构建可重复的AI代理评估框架,利用LangChain、Ollama和Qwen测试本地代理,并获得明确的通过/失败结果。
本文介绍了GenAI Evaluation,一个受管控且配置驱动的管道,用于零售对话代理的可扩展多维度评估。它通过使用LLM作为评判员的评分与选择性重新评估实现了高精度,并经过人工标注数据验证。
介绍了Eval-Pair Matrix,一种针对有源检索增强生成(RAG)的受控元评估协议,通过诱导隐藏矛盾来检测LLM评判者的自我宽容性。研究发现同模型效应极小,并强调了对RAG评判者研究方法论的改进。
本文分析了LLM-as-a-Judge在多语言和低资源场景下的应用,发现评估结果不一致且过度信任LLM判断,并提出了改进实践的建议。
LLM-as-a-Judge 概念的快速介绍,解释如何构建 AI 验证器和裁判,并指出进一步学习的资源。
本文测试了LLMs在上下文问答中判断能力优于生成能力的假设,发现在大多数基准上生成准确率超过自我评估,且评估过程对上下文的关注较少。这些发现挑战了自我评估流程中的核心假设。
本文研究了LLM-as-a-Judge评估的运行间可靠性,发现平均13.6%的成对偏好会发生翻转,GPT-4o-mini存在显著的首位偏见,并建议采用多试次聚合与位置随机化。