llm-as-a-judge

标签

Cards List
#llm-as-a-judge

超越分数对齐的 LLM-as-a-Judge 评估:残差评分难度的心理测量学分析

arXiv cs.CL ↗ · 14小时前 缓存

该论文从心理测量学视角评估 LLM-as-a-Judge,使用 Many-Facet Rasch 模型将评分分解为潜在质量、评分者严苛度与残差难度,发现人类与 LLM 在汇总对齐之外仍存在明显的残差难度结构错配。

0 人收藏 0 人点赞
#llm-as-a-judge

@suraj_sharma14:作为 AI 评测工程师,你必须完成以下这些项目。 1.)轨迹评分引擎(Trajectory Grading Engine)构建:一个步骤级别的评估器,用于……

X AI KOLs Timeline ↗ · 昨天 缓存

# AI Evals 工程师必做的 15 个实战项目 一位从业者梳理了 15 个 AI Evals 工程师必建的项目,涵盖以下方向: 1. 轨迹评分(trajectory grading) 2. 影子路由(shadow routing) 3. 带校准的 LLM-as-a-Judge 4. CI/CD 回归门禁 5. 对抗性 RAG 测试 6. DPO 微调飞轮 7. 统计显著性 8. Agent 红队测试 9. 漂移监控 10. 成本-质量看板 11. 反事实回放调试(counterfactual replay debugging) 12. 合成边缘用例生成 13. 上下文窗口淘汰测试(context-window eviction tests) 14. 数据集污染检查 15. 公开评测方法论拆解(public eval methodology teardowns)

0 人收藏 0 人点赞
#llm-as-a-judge

用于鲁棒成对LLM评判的骨干自适应证据路由

arXiv cs.AI ↗ · 2026-09-28 缓存

BAER引入了一种骨干自适应证据路由方法,用于鲁棒的成对LLM评判,通过根据条件动态选择证据机制,在多个基准测试中实现了更高的准确性。

0 人收藏 0 人点赞
#llm-as-a-judge

CARGO: 面向生产环境中智能体AI的上下文感知检索门控评估

arXiv cs.CL ↗ · 2026-09-28 缓存

本文介绍Cargo框架,用于评估智能体AI系统。该框架通过将事实判断基于实时上下文并基于检索置信度对评估进行门控,以解决参考实例分歧问题,并引入用于基准测试的Cargo-Bench。

0 人收藏 0 人点赞
#llm-as-a-judge

JEV-as-a-Judge: 自信时接受,不确定时上报

Hugging Face Daily Papers ↗ · 2026-09-22 缓存

本文介绍了JEV-as-a-Judge,这是一种用于大型语言模型(LLMs)的经济高效评估方法,它使用一个仅基于决策的评判器,设置置信度阈值来接受确定的判定并上报不确定的判定,以显著更低的成本实现了与最先进模型相当的准确性。

0 人收藏 0 人点赞
#llm-as-a-judge

超越姓名:去识别化简历中的人口统计泄露与LLM偏差审计中的评估假象

arXiv cs.CL ↗ · 2026-09-16 缓存

本研究探讨了从去识别化简历中移除语言字段是否能防止LLM偏差审计中的人口统计泄露,发现非语言文本仍允许推断,且评估设计对结果有显著影响。

0 人收藏 0 人点赞
#llm-as-a-judge

推理是否能提升大型语言模型的心理深度?这取决于评判者是谁。

arXiv cs.LG ↗ · 2026-09-15 缓存

研究调查了LLM-as-a-Judge评估者是否能可靠地评估LLM生成故事的心理深度,揭示了人类偏好的异质性,而评判者则基于表层特征对推理输出表现出偏见。

0 人收藏 0 人点赞
#llm-as-a-judge

噪声如何滋生偏见:噪声文本下LLM评判者偏见测量的脆弱性

arXiv cs.CL ↗ · 2026-09-11 缓存

本文研究文本表面噪声如何影响LLM评判者的偏见测量,发现噪声会系统性地高估偏见,尤其是在公平关键类别中,并引入了Fable基准来研究这一问题。

0 人收藏 0 人点赞
#llm-as-a-judge

@LangChain:将编码代理指向 LangSmith CLI,它就能为你构建一个在线的 LLM-as-a-judge:定义评分标准,连接到……

X AI KOLs Timeline ↗ · 2026-09-10 缓存

一个关于使用编码代理与 LangSmith CLI 来设置在线 LLM-as-a-judge 以评估 LLM 追踪的教程,所有配置都可从终端进行。

0 人收藏 0 人点赞
#llm-as-a-judge

通过人类对齐设计用于药物发现代理AI的健壮LLM评估系统

arXiv cs.LG ↗ · 2026-08-24 缓存

本文提出一种用于药物发现代理AI的LLM-as-a-Judge评估框架,通过专家标注者的人类对齐研究验证。优化法官模型以提升与人类判断的契合度,并为科学领域可重用评估提供洞见。

0 人收藏 0 人点赞
#llm-as-a-judge

大型推荐解释中LLM-as-a-Judge的生命周期

arXiv cs.AI ↗ · 2026-08-20 缓存

本文提出了一个在Netflix使用大语言模型作为评判者来评估推荐解释的生命周期框架,涵盖从开发到部署和监控的各个阶段,并通过A/B测试取得了积极结果,显示用户参与度得到提升。

0 人收藏 0 人点赞
#llm-as-a-judge

通过随机数生成缓解 LLM-as-a-Judge 中的评分偏差

arXiv cs.CL ↗ · 2026-08-07 缓存

本文提出了一种新方法,通过让 LLM 随机生成数字来测量其潜在的数字偏差,并据此修正 token 生成概率,从而缓解 LLM-as-a-Judge 中的评分偏差。在四个任务上的实验表明,该方法优于基线方法,并揭示了评分偏差在不同模型、任务和分数区间上的差异。

0 人收藏 0 人点赞
#llm-as-a-judge

SysAdmin:衡量前沿AI中的工具性权力寻求

arXiv cs.AI ↗ · 2026-07-22 缓存

本文介绍了SysAdmin基准,该基准将前沿语言模型置于高保真Linux沙箱中扮演自主系统管理员角色,以衡量其权力寻求倾向。在2800个任务中,作者发现自发权力寻求行为极少(偏差校正后为0-5%),但识别出其他故障模式,如规格游戏和对目标修改的抵抗。

0 人收藏 0 人点赞
#llm-as-a-judge

@freeCodeCamp: AI代理在不同运行中表现可能不同,这使得回归问题难以捕获。在本教程中,Dar…

X AI KOLs Following ↗ · 2026-07-21 缓存

本教程演示了如何使用基于规则的检查和LLM-as-a-judge来构建可重复的AI代理评估框架,利用LangChain、Ollama和Qwen测试本地代理,并获得明确的通过/失败结果。

0 人收藏 0 人点赞
#llm-as-a-judge

实现对话代理的多维度评估:一个可扩展、受管控的管道,具备选择性重新评估与模型基准测试

arXiv cs.AI ↗ · 2026-07-15 缓存

本文介绍了GenAI Evaluation,一个受管控且配置驱动的管道,用于零售对话代理的可扩展多维度评估。它通过使用LLM作为评判员的评分与选择性重新评估实现了高精度,并经过人工标注数据验证。

0 人收藏 0 人点赞
#llm-as-a-judge

Eval-Pair Matrix:面向有源检索增强生成的LLM评判者答案配对元评估

arXiv cs.CL ↗ · 2026-07-14 缓存

介绍了Eval-Pair Matrix,一种针对有源检索增强生成(RAG)的受控元评估协议,通过诱导隐藏矛盾来检测LLM评判者的自我宽容性。研究发现同模型效应极小,并强调了对RAG评判者研究方法论的改进。

0 人收藏 0 人点赞
#llm-as-a-judge

LLMs-as-a-Judge在多语言环境和低资源语言中的挑战与建议

arXiv cs.CL ↗ · 2026-07-03 缓存

本文分析了LLM-as-a-Judge在多语言和低资源场景下的应用,发现评估结果不一致且过度信任LLM判断,并提出了改进实践的建议。

0 人收藏 0 人点赞
#llm-as-a-judge

@omarsar0: LLM-as-a-Judge 在约10分钟内解析

X AI KOLs Following ↗ · 2026-06-29 缓存

LLM-as-a-Judge 概念的快速介绍,解释如何构建 AI 验证器和裁判,并指出进一步学习的资源。

0 人收藏 0 人点赞
#llm-as-a-judge

LLMs判断能力是否强于生成能力?评估上下文问答中的任务不对称性、机制可解释性与可迁移性

arXiv cs.CL ↗ · 2026-06-29 缓存

本文测试了LLMs在上下文问答中判断能力优于生成能力的假设,发现在大多数基准上生成准确率超过自我评估,且评估过程对上下文的关注较少。这些发现挑战了自我评估流程中的核心假设。

0 人收藏 0 人点赞
#llm-as-a-judge

抛硬币裁判?LLM-as-a-Judge评估的可靠性与偏见

arXiv cs.CL ↗ · 2026-06-15 缓存

本文研究了LLM-as-a-Judge评估的运行间可靠性,发现平均13.6%的成对偏好会发生翻转,GPT-4o-mini存在显著的首位偏见,并建议采用多试次聚合与位置随机化。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈