llm-as-a-judge

标签

Cards List
#llm-as-a-judge

基于标准的强化学习中奖励黑客行为的复现、分析与检测

Hugging Face Daily Papers ↗ · 2026-06-03

本文介绍了CHERRL,一个用于研究基于标准的强化学习中奖励黑客行为的可控环境。在该环境中,可以注入LLM作为评判者的偏见,以复现和分析黑客行为。作者还探索了一种基于智能体的系统,用于从训练日志中自动检测奖励黑客行为的开始。

0 人收藏 0 人点赞
#llm-as-a-judge

面向LLM-as-a-Judge的动态评估准则生成与优化

arXiv cs.CL ↗ · 2026-06-01 缓存

本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。

0 人收藏 0 人点赞
#llm-as-a-judge

评估使用模拟工具调用隔离不可信提示输入

arXiv cs.CL ↗ · 2026-06-01 缓存

本文评估了将不可信内容包装在模拟工具调用中是否能提高LLM对抗对抗性输入的鲁棒性,发现这并不能广泛改善,有时反而会增加攻击成功率。

0 人收藏 0 人点赞
#llm-as-a-judge

RankJudge:一个多轮LLM-as-a-Judge合成基准生成器

arXiv cs.CL ↗ · 2026-05-22 缓存

RankJudge是一个基准生成器,它创建带有注入缺陷的配对多轮对话,用于评估LLM评判者在复杂对话中正确识别更好和更差回复的能力。

0 人收藏 0 人点赞
#llm-as-a-judge

评判电路

arXiv cs.CL ↗ · 2026-05-18 缓存

本文研究了LLM-as-a-judge的内部机制,发现模型在中期到后期的多层感知机(MLP)中共享一个稀疏的潜在评估器子图,该子图处理抽象评判,而格式特定的终端分支将评判映射到输出令牌,揭示了格式导致的不一致性的原因。

0 人收藏 0 人点赞
#llm-as-a-judge

Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks

arXiv cs.CL ↗ · 2026-05-12 缓存

This article introduces Magis-Bench, a benchmark for evaluating large language models on magistrate-level legal tasks such as judicial reasoning and sentence drafting, using data from Brazilian judicial exams.

0 人收藏 0 人点赞
#llm-as-a-judge

@ArizePhoenix:谁来评判评估者?当你使用LLM作为评判者时,你正在信任一个模型来决定你的代理、工作流……

X AI KOLs Following ↗ · 2026-05-07

本文讨论了使用Arize Phoenix调试和评估LLM评判者所面临的挑战,Arize Phoenix通过OpenTelemetry追踪评估者运行过程,以检查决策逻辑、成本和潜在偏差。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈