llm-as-a-judge

标签

Cards List
#llm-as-a-judge

通过随机数生成缓解 LLM-as-a-Judge 中的评分偏差

arXiv cs.CL · 2026-08-07 缓存

本文提出了一种新方法,通过让 LLM 随机生成数字来测量其潜在的数字偏差,并据此修正 token 生成概率,从而缓解 LLM-as-a-Judge 中的评分偏差。在四个任务上的实验表明,该方法优于基线方法,并揭示了评分偏差在不同模型、任务和分数区间上的差异。

0 人收藏 0 人点赞
#llm-as-a-judge

SysAdmin:衡量前沿AI中的工具性权力寻求

arXiv cs.AI · 2026-07-22 缓存

本文介绍了SysAdmin基准,该基准将前沿语言模型置于高保真Linux沙箱中扮演自主系统管理员角色,以衡量其权力寻求倾向。在2800个任务中,作者发现自发权力寻求行为极少(偏差校正后为0-5%),但识别出其他故障模式,如规格游戏和对目标修改的抵抗。

0 人收藏 0 人点赞
#llm-as-a-judge

@freeCodeCamp: AI代理在不同运行中表现可能不同,这使得回归问题难以捕获。在本教程中,Dar…

X AI KOLs Following · 2026-07-21 缓存

本教程演示了如何使用基于规则的检查和LLM-as-a-judge来构建可重复的AI代理评估框架,利用LangChain、Ollama和Qwen测试本地代理,并获得明确的通过/失败结果。

0 人收藏 0 人点赞
#llm-as-a-judge

实现对话代理的多维度评估:一个可扩展、受管控的管道,具备选择性重新评估与模型基准测试

arXiv cs.AI · 2026-07-15 缓存

本文介绍了GenAI Evaluation,一个受管控且配置驱动的管道,用于零售对话代理的可扩展多维度评估。它通过使用LLM作为评判员的评分与选择性重新评估实现了高精度,并经过人工标注数据验证。

0 人收藏 0 人点赞
#llm-as-a-judge

Eval-Pair Matrix:面向有源检索增强生成的LLM评判者答案配对元评估

arXiv cs.CL · 2026-07-14 缓存

介绍了Eval-Pair Matrix,一种针对有源检索增强生成(RAG)的受控元评估协议,通过诱导隐藏矛盾来检测LLM评判者的自我宽容性。研究发现同模型效应极小,并强调了对RAG评判者研究方法论的改进。

0 人收藏 0 人点赞
#llm-as-a-judge

LLMs-as-a-Judge在多语言环境和低资源语言中的挑战与建议

arXiv cs.CL · 2026-07-03 缓存

本文分析了LLM-as-a-Judge在多语言和低资源场景下的应用,发现评估结果不一致且过度信任LLM判断,并提出了改进实践的建议。

0 人收藏 0 人点赞
#llm-as-a-judge

@omarsar0: LLM-as-a-Judge 在约10分钟内解析

X AI KOLs Following · 2026-06-29 缓存

LLM-as-a-Judge 概念的快速介绍,解释如何构建 AI 验证器和裁判,并指出进一步学习的资源。

0 人收藏 0 人点赞
#llm-as-a-judge

LLMs判断能力是否强于生成能力?评估上下文问答中的任务不对称性、机制可解释性与可迁移性

arXiv cs.CL · 2026-06-29 缓存

本文测试了LLMs在上下文问答中判断能力优于生成能力的假设,发现在大多数基准上生成准确率超过自我评估,且评估过程对上下文的关注较少。这些发现挑战了自我评估流程中的核心假设。

0 人收藏 0 人点赞
#llm-as-a-judge

抛硬币裁判?LLM-as-a-Judge评估的可靠性与偏见

arXiv cs.CL · 2026-06-15 缓存

本文研究了LLM-as-a-Judge评估的运行间可靠性,发现平均13.6%的成对偏好会发生翻转,GPT-4o-mini存在显著的首位偏见,并建议采用多试次聚合与位置随机化。

0 人收藏 0 人点赞
#llm-as-a-judge

基于标准的强化学习中奖励黑客行为的复现、分析与检测

Hugging Face Daily Papers · 2026-06-03

本文介绍了CHERRL,一个用于研究基于标准的强化学习中奖励黑客行为的可控环境。在该环境中,可以注入LLM作为评判者的偏见,以复现和分析黑客行为。作者还探索了一种基于智能体的系统,用于从训练日志中自动检测奖励黑客行为的开始。

0 人收藏 0 人点赞
#llm-as-a-judge

面向LLM-as-a-Judge的动态评估准则生成与优化

arXiv cs.CL · 2026-06-01 缓存

本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。

0 人收藏 0 人点赞
#llm-as-a-judge

评估使用模拟工具调用隔离不可信提示输入

arXiv cs.CL · 2026-06-01 缓存

本文评估了将不可信内容包装在模拟工具调用中是否能提高LLM对抗对抗性输入的鲁棒性,发现这并不能广泛改善,有时反而会增加攻击成功率。

0 人收藏 0 人点赞
#llm-as-a-judge

RankJudge:一个多轮LLM-as-a-Judge合成基准生成器

arXiv cs.CL · 2026-05-22 缓存

RankJudge是一个基准生成器,它创建带有注入缺陷的配对多轮对话,用于评估LLM评判者在复杂对话中正确识别更好和更差回复的能力。

0 人收藏 0 人点赞
#llm-as-a-judge

评判电路

arXiv cs.CL · 2026-05-18 缓存

本文研究了LLM-as-a-judge的内部机制,发现模型在中期到后期的多层感知机(MLP)中共享一个稀疏的潜在评估器子图,该子图处理抽象评判,而格式特定的终端分支将评判映射到输出令牌,揭示了格式导致的不一致性的原因。

0 人收藏 0 人点赞
#llm-as-a-judge

Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks

arXiv cs.CL · 2026-05-12 缓存

This article introduces Magis-Bench, a benchmark for evaluating large language models on magistrate-level legal tasks such as judicial reasoning and sentence drafting, using data from Brazilian judicial exams.

0 人收藏 0 人点赞
#llm-as-a-judge

@ArizePhoenix:谁来评判评估者?当你使用LLM作为评判者时,你正在信任一个模型来决定你的代理、工作流……

X AI KOLs Following · 2026-05-07

本文讨论了使用Arize Phoenix调试和评估LLM评判者所面临的挑战,Arize Phoenix通过OpenTelemetry追踪评估者运行过程,以检查决策逻辑、成本和潜在偏差。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈