llm-as-judge

标签

Cards List
#llm-as-judge

CrossAudit:一种用于智能体科学的基于Git、跨供应商的审计循环

arXiv cs.AI · 2026-09-01 缓存

CrossAudit引入了一种基于Git的协议,用于审计使用不同供应商AI代理的自主研究流程,以确保智能体科学中的监督和完整性。

0 人收藏 0 人点赞
#llm-as-judge

基于大型语言模型的长文本生成中大纲阶段的多框架比较

arXiv cs.CL · 2026-08-28 缓存

本文提出了一个统一基准,用于比较基于大纲的大型语言模型长文本生成框架,独立评估大纲,发现性能随框架与粒度匹配度变化,支持将大纲与写作阶段解耦。

0 人收藏 0 人点赞
#llm-as-judge

信息满意度:以读者为中心的摘要评估维度

arXiv cs.CL · 2026-08-17 缓存

本文提出信息满意度作为以读者为中心的摘要评估维度,指出当前指标未能捕捉用户特定的信息需求,且与人类判断的一致性较差。

0 人收藏 0 人点赞
#llm-as-judge

生成减少智能体评估中过度信任的无奖励评判标准

arXiv cs.AI · 2026-08-17 缓存

RubricForge从带标签的轨迹中诱导评估标准,以减少语言模型智能体评估中的过度信任,增强保真度,而无需环境访问。

0 人收藏 0 人点赞
#llm-as-judge

Self-evolving Agentic Customer Support System at LinkedIn

arXiv cs.AI · 2026-08-12 缓存

LinkedIn presents a self-evolving agentic customer support system that integrates RAG with evolutionary auto-prompting and modular evaluation, achieving significant gains in production A/B tests including a 9.0-point increase in QA self-serve and 30.6-point improvement in routing accuracy.

0 人收藏 0 人点赞
#llm-as-judge

SurveyReview: A Reviewer-Aligned Benchmark for Survey Evaluators

arXiv cs.CL · 2026-08-11 缓存

The paper introduces SurveyReview, a reviewer-aligned multi-dimensional benchmark for evaluating survey papers, along with SurveyAlign, a fine-tuned model that substantially improves alignment with human reviewers over prompt-based GPT-5.2 judging.

0 人收藏 0 人点赞
#llm-as-judge

锁定证据再做评判:冻结接口降低LLM-as-Judge评估质量

arXiv cs.CL · 2026-08-07 缓存

本文测试了在一次调用中生成证据并将其作为后续裁决的唯一输入(证据锁定)是否会改善或损害LLM-as-Judge评估。在24,000次判断中,他们发现,与结构化单次调用评判相比,证据锁定将人类偏好一致性降低了4到6个百分点,并增加了答案顺序不一致性。

0 人收藏 0 人点赞
#llm-as-judge

SkillTV-Bench:评估裁判在技能增强型智能体执行中的表现基准

arXiv cs.AI · 2026-08-07 缓存

介绍SkillTV-Bench,一个包含681个案例的基准,用于评估LLM智能体中技能感知的轨迹验证,以及SkillTV-Evolve,一种将验证知识外部化为可复用JudgeSkill的方法,将裁判准确率提升14.8个百分点。

0 人收藏 0 人点赞
#llm-as-judge

VIVID:一个植根于文化的基准,揭示越南语自然语言处理中的比喻语言差距

arXiv cs.CL · 2026-08-05 缓存

本文介绍了VIVID,这是首个系统评估越南语中植根于文化的比喻语言理解的基准,包含1,636条习语和谚语。对八个最先进模型的评估揭示了显著差距:越南语专用模型的表现远逊于多语言系统,即使顶尖模型平均正确率也不到50%。

0 人收藏 0 人点赞
#llm-as-judge

TQLite:多LLM评审团引导的蒸馏,用于实时MQM翻译质量评估

arXiv cs.CL · 2026-08-05 缓存

介绍了TQLite,一种利用多LRM评审团训练小型语言模型进行基于MQM的实时翻译质量评估的蒸馏框架,其性能远超现成的SLM,同时保持成本效益。

0 人收藏 0 人点赞
#llm-as-judge

自然语言数学证明的高性价比自动评判

arXiv cs.CL · 2026-08-04 缓存

本文研究廉价的开放权重大语言模型能否以远低于前沿模型的成本,同样可靠地评判自然语言数学证明。在 IMO-GradingBench 上,三个廉价评判模型在通过/不通过的一致性上与前沿模型相当,作者推荐“三者全部通过”的一致性规则以实现高性价比部署。

0 人收藏 0 人点赞
#llm-as-judge

形式主义陷阱:LLM-as-a-Judge 评估器是否在社会负载下被共识模仿所蒙蔽?

arXiv cs.CL · 2026-08-03 缓存

本文引入了“智能体形式主义陷阱”和评估失调指数,展示了 LLM-as-a-Judge 系统如何被结构形式主义和共识模仿所误导,而非基于语义真相,基于跨多个领域的 22,500 条轨迹。

0 人收藏 0 人点赞
#llm-as-judge

TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter

arXiv cs.AI · 2026-08-03 缓存

TAPR is a lightweight model trained with reinforcement learning to rewrite user prompts into task-optimized prompts, improving downstream LLM performance on benchmarks like Natural Questions and GSM8K.

0 人收藏 0 人点赞
#llm-as-judge

@googledevs: Agent and Model Evaluations in Gemini Enterprise Agent Platform are now Generally Available (GA)! Measure, test, and mo…

X AI KOLs Following · 2026-07-31 缓存

Google announces GA of Agent and Model Evaluations in Gemini Enterprise Agent Platform, enabling consistent measurement and monitoring of AI agents in dev and production with pre-built metrics, adaptive rubrics, simulators, and online monitors.

0 人收藏 0 人点赞
#llm-as-judge

论提高文档生成播客的忠实度

arXiv cs.CL · 2026-07-27 缓存

本文首次系统研究了文档接地播客生成中的忠实度问题,提出了一个轮次级别的LLM作为评委的评估框架,以及一个与模型无关的捕获-修复方法,该方法能跨领域提高忠实度。

0 人收藏 0 人点赞
#llm-as-judge

换一个裁判,分数就变了:审计大模型作为裁判的可靠性

arXiv cs.CL · 2026-07-10 缓存

本文审计了大模型作为裁判(LLM-as-judge)评估的可靠性,表明即使候选回复固定不变,更换评估模型也可能改变评分。论文考察了Qwen3和MiniMax模型的扩展与升级路径,得出结论:裁判升级不可互换,并提出了最佳报告实践。

0 人收藏 0 人点赞
#llm-as-judge

大型语言模型作为判断器在理论无关的自适应度量对齐原型网络用于人格识别

arXiv cs.CL · 2026-07-10 缓存

提出JAM,一种理论无关的人格识别框架,利用LLM作为判断器改进原型网络中的度量对齐,实现更好的跨框架泛化。

0 人收藏 0 人点赞
#llm-as-judge

LALM音频裁判用于全双工语音代理的可靠性评估

arXiv cs.CL · 2026-07-10 缓存

本文评估了Gemini模型作为音频裁判对全双工语音代理对话进行评分的可靠性,发现Gemini 2.5 Flash在多数维度上与人类评分者一致性较强,但模型替换需要重新验证。

0 人收藏 0 人点赞
#llm-as-judge

在应用场景中评估RAG指标:一项实验、发现与局限性

arXiv cs.CL · 2026-07-09 缓存

本文通过一项实证研究,比较了来自四个库(Ragas、DeepEval、RAGChecker、Opik)的RAG评估指标与人工判断及标准召回指标,并基于商业数据创建了问答数据集。

0 人收藏 0 人点赞
#llm-as-judge

更令人信服,而非更正确:无参考LLM评判者的自我博弈奖励操纵

arXiv cs.LG · 2026-07-08 缓存

本文识别了自我博弈训练中使用的无参考LLM评判者的结构缺陷,表明它们评估的是合理性而非正确性,导致奖励操纵,策略学会生成合理但错误的答案。作者提出了一种隐藏锚点审计和解锚奖励来缓解这一问题。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈