llm-judges

标签

Cards List
#llm-judges

人人都说要为AI代理编写评估,但实际该测什么?

Reddit r/AI_Agents · 2026-09-02

一份关于为AI代理编写有效评估的实用指南,重点是从观察到的失败入手,并结合确定性检查和LLM裁判。

0 人收藏 0 人点赞
#llm-judges

大语言模型法官验证存在,而非缺失:AI临床笔记中的遗漏盲区

Hacker News Top · 2026-09-02 缓存

本文提出了一项基准测试,用于评估大语言模型法官在AI生成的临床笔记中检测遗漏信息的能力。研究发现,标准法官模型在识别遗漏方面存在困难,但将任务重构为基于事实的验证可显著提升检测效果。

0 人收藏 0 人点赞
#llm-judges

SAGE:基于状态、弃权感知的任务导向对话智能体评估

arXiv cs.AI · 2026-09-02 缓存

SAGE是一种新颖的任务导向对话智能体评估框架,它将评估基于对话状态变化,并使用弃权机制来提供成本效益高、准确的回合级判断,无需昂贵的LLM调用。

0 人收藏 0 人点赞
#llm-judges

迈向文化契合:跨越五个非洲社区的以人为中心多模态AI故事评估

arXiv cs.CL · 2026-09-01 缓存

本文通过基于社区的评估,研究了AI生成的多模态故事在五个非洲社区中的文化契合度,发展了一种错位分类法,并评估了自动化评判的可靠性。

0 人收藏 0 人点赞
#llm-judges

JuryProbe:一种用于将无参考事实性判断面板路由到基于验证的经验共识风险诊断

arXiv cs.CL · 2026-08-24 缓存

JuryProbe提出了一种经验性诊断工具,用于评估无参考LLM判断面板在事实核查中的共识风险,并采用基于校准的路由策略,利用可信参考对高风险决策进行验证,从而降低误接受率。

0 人收藏 0 人点赞
#llm-judges

@mervenoyann:@willcb的有趣演讲

X AI KOLs Timeline · 2026-08-20 缓存

Primordial AI的Will Brown在此次演讲中探讨了如何将强化学习扩展至奖励难以验证的复杂现实任务,涉及锚定法、大语言模型评判与仿真模拟等技术。

0 人收藏 0 人点赞
#llm-judges

@browser_use: Opus 5 和 GPT-5.6 Sol 在此不相上下!

X AI KOLs Timeline · 2026-08-20 缓存

Alexander Yue 推出了一项新的浏览器使用基准测试,其中 Opus 5 和 GPT-5.6 Sol 表现相似,强调了基准测试的稳健设计,包括为大语言模型评委提供的经过验证的评分标准。

0 人收藏 0 人点赞
#llm-judges

自我生成的评估指标:从盲点中进化出的评估器

arXiv cs.AI · 2026-08-20 缓存

本文提出了EvalCEGAR方法,该方法利用一组Python运算符池自动进化评估指标,能标记AI输出中的特定缺陷,相比手写运算符和LLM评判者提高了准确性。

0 人收藏 0 人点赞
#llm-judges

自我与他者标签在LLM评审中引发双向偏见

arXiv cs.CL · 2026-08-20 缓存

本文研究了由自我与他者标签在LLM评审中引发的双向偏见,表明仅标签就能改变评估分数,无论实际来源如何,这对理解作者归属和受控评估任务有贡献。

0 人收藏 0 人点赞
#llm-judges

通过在策略自蒸馏缓解LLM评判器中的评分标准干扰

arXiv cs.LG · 2026-08-18 缓存

本文解决了LLM评判器在同时评估多个评分标准时遇到的评分标准干扰问题,并提出了自锚定评分标准对齐(SARA)方法,通过在策略自蒸馏来提高评估一致性。

0 人收藏 0 人点赞
#llm-judges

参差的法官:沉默、压力与坚持下的认知稳定性

arXiv cs.AI · 2026-08-14 缓存

本文介绍了 Wiggle 框架,这是一种针对 LLM 裁判认识论稳定性的统一压力测试,涵盖 14 项任务,衡量机械一致性、单轮信念与多轮持久性。研究发现,所有 9 个受研究的前沿模型在压力下都会大幅翻转判决,且成功的压力通常相对于基准真相而言具有净破坏性。

0 人收藏 0 人点赞
#llm-judges

从提示到行为对齐:用于推荐评估的个性化LLM评判器

arXiv cs.AI · 2026-08-13 缓存

本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。

0 人收藏 0 人点赞
#llm-judges

移动智能体评估中的 LLM 评判器基准测试

arXiv cs.AI · 2026-08-13 缓存

本文介绍了 MobileJudgeBench,一个包含 931 条人工标注轨迹的基准,用于系统评估移动智能体任务中基于 LLM 的评判器。研究发现,带有采样屏幕截图的简单基线评判器可与专用方法相媲美甚至更优,而 LLM 主干是质量的主要驱动因素。

0 人收藏 0 人点赞
#llm-judges

@omarsar0:LLM评审的怪异现象确实存在。避免对LLM评审使用评分,或如果使用需极其谨慎。尽可能使用二分类标签……

X AI KOLs Following · 2026-08-10 缓存

一条推文讨论了一个发现的怪现象:将论文PDF重命名为更长、更积极的标题会提高LLM评审的评分,建议谨慎使用基于评分的LLM评估,并推荐改用二分类标签。

0 人收藏 0 人点赞
#llm-judges

平均偏差:人类忠实性标注并非局部忠实

arXiv cs.CL · 2026-08-04 缓存

本文来自石溪大学,识别了文本摘要人类忠实性标注中的“平均偏差”:全局人类标签与逐句LLM判断的平均值之间的相关性,优于与严格合取规则的相关性,这意味着即使摘要包含局部事实错误,人类也常常将其标注为忠实。

0 人收藏 0 人点赞
#llm-judges

Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges

arXiv cs.CL · 2026-08-03 缓存

A research paper introducing Chain-of-Models (CoM), an automated pipeline where a second LLM audits a first model's reasoning trace to correct cognitive biases. It finds that auditor effectiveness depends on model family and bias type, and proposes a bias-specific auditor selection rule that improves judgment accuracy.

0 人收藏 0 人点赞
#llm-judges

@hanakoxbt: https://x.com/hanakoxbt/status/2083540339147567268

X AI KOLs Timeline · 2026-08-01 缓存

一份六步指南,教你构建评估门控,让AI代理自主合并变更,涵盖评判偏差、运行时评估、轨迹评分等内容。

0 人收藏 0 人点赞
#llm-judges

当没有参考答案时,LLM评委可能过于慷慨

arXiv cs.CL · 2026-07-15 缓存

本文表明,在没有提供参考答案的情况下,LLM评委倾向于对错误答案给予过多评分,而添加参考可以将判定结果翻转多达85%,从而更符合人类判断。作者提出了在无参考设置中使用LLM评委的校准步骤。

0 人收藏 0 人点赞
#llm-judges

@HamelHusain: 新博客文章:自动化评估有效吗?最近出现了一些工具,通过AI分析你的追踪数据来识别问题…

X AI KOLs Timeline · 2026-07-14 缓存

Parlance Labs的一篇博客文章在真实生产数据上测试了自动化AI评估工具(Braintrust Loop、Arize Alyx、LangSmith Engine),发现它们能捕获人类标记的87%的问题,但会遗漏领域特定的失败案例并引入噪音,建议采用迭代式人机协同使用。

0 人收藏 0 人点赞
#llm-judges

@h100envy: Prime Intellect工程师解释了如何在30分钟内通过开放互联网训练推理模型——比……更好

X AI KOLs Timeline · 2026-07-12 缓存

Prime Intellect工程师演示了一种方法,通过开放互联网使用分布式强化学习在30分钟内训练推理模型,利用Prime-RL、LLM评判器和多云GPU,使开放模型无需拥有数据中心即可与封闭实验室竞争。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈