llm-judge

标签

Cards List
#llm-judge

Position: Evaluation Scores Are Perishable Knowledge Claims

arXiv cs.AI · 2天前 缓存

This position paper argues that language model evaluation scores should be treated as perishable knowledge claims, not ground truth, and proposes explicit metadata such as formality tier, scope declaration, and expiration date to counter 'trust inflation' caused by averaging weak and strong signals.

0 人收藏 0 人点赞
#llm-judge

@LangChain:@Similarweb 如何在没有唯一正确答案的情况下评估深度研究代理:工具调用的确定性检查……

X AI KOLs Timeline · 3天前 缓存

本文介绍了 Similarweb 如何使用 LangSmith 评估长篇代理研究报告,结合工具调用的确定性检查和 LLM 作为评委的质量评分,重点关注使回归可检查并实现 A/B 比较。

0 人收藏 0 人点赞
#llm-judge

@josephdecker: 我的16款模型评测中,冠军在审计中被发现编造了5次。第二名仅差0.1分,零编造……

X AI KOLs Timeline · 2026-07-24 缓存

Joseph Decker 为他的产品 Condensr 评估了16个AI模型的真实性,发现排行榜冠军在审计中五次编造内容,于是转而部署了零编造的第二名模型。这篇文章详细介绍了评估过程、LLM判断器中的一个漏洞(由于截断的转录而惩罚了准确的摘要),以及自定义评估优于通用基准的重要性。

0 人收藏 0 人点赞
#llm-judge

一款自我教学的分类器:用于动态文档分类的自我改进式冻结门训练(SIFT)

arXiv cs.CL · 2026-07-22 缓存

SIFT引入了一种自我改进的文档分类器,它使用成本低廉的SPLADE-LightGBM管道和LLM评判器持续自我教学,同时通过冻结门安全机制防止无声退化,从而无需人工标注开销即可实现自主再训练。

0 人收藏 0 人点赞
#llm-judge

在信息缺失情况下评估医疗人工智能:同源评审者与人工评分者改变表观安全性

arXiv cs.AI · 2026-07-22 缓存

本文将信息缺失压力测试推广至开放式医疗对话,发现大语言模型评审者的选择会显著改变表观安全性,且LLM评审者比临床医生更为宽松。

0 人收藏 0 人点赞
#llm-judge

EduPanel: 一种用于教学视频的三智能体LLM评判器——可靠性、互补性与人类信任校准

Hugging Face Daily Papers · 2026-07-20 缓存

EduPanel是一种基于评分标准、面向学习者的LLM评判器,它使用三个专门的智能体来评估教学视频质量,实现了与人类专家相当的可靠性,同时提高了评分准确性并保持对不可靠输出的可检测性。

0 人收藏 0 人点赞
#llm-judge

清晰的直觉还是真正的分析?在LLM作为评审人的同行评审中基准测试认知可靠性

arXiv cs.CL · 2026-07-14 缓存

本文介绍了Kahneman4Review基准,包含3,563条同行评审,这些评审按照九个理论驱动的文本维度、八个偏见诊断和一个连续的推理质量评分进行评定,旨在评估LLM评审者能否区分同行评审中的分析性形式与真实的认知质量。

0 人收藏 0 人点赞
#llm-judge

CAFE:一种复合AI因子评估框架

arXiv cs.CL · 2026-07-14 缓存

CAFE是一个开源平台,应用实验设计原则来评估复合AI系统,通过因子设计和混合效应模型将答案质量差异归因于组件及其交互作用。

0 人收藏 0 人点赞
#llm-judge

你需要一个前沿模型作为引用验证器吗?——针对深度研究来源归因的评估LLM基准测试

arXiv cs.CL · 2026-07-10 缓存

本文对8个用于深度研究系统中引用质量的LLM评估器进行了基准测试,发现较便宜的模型在来源相关性和事实支持方面仍与前沿模型竞争,但在方向偏差上有所不同,这对强化学习训练很重要。

0 人收藏 0 人点赞
#llm-judge

文本到SQL正确性的预测因素:一项选择性预测研究

arXiv cs.LG · 2026-07-09 缓存

本文研究了在选择性预测中哪些信号最能预测文本转SQL的正确性。研究发现,来自LLM判断器的基于验证的信号优于黑盒统计信号(如自一致性),并且双提供者集成模型实现了0.82的AUROC,同时具有良好校准的概率。

0 人收藏 0 人点赞
#llm-judge

训练治疗性评判器与多智能体系统以实现与人类对齐的心理健康支持

arXiv cs.CL · 2026-07-01 缓存

本文介绍了TheraJudge和TheraAgent,这是一个利用多维度人类对齐评估来改进大语言模型治疗性回复生成的框架,在质量和安全性方面取得了显著提升。

0 人收藏 0 人点赞
#llm-judge

@akshay_pachaar: 如果你使用LLM作为评判,这篇内容就是为你准备的。(请收藏)大多数团队通过调用一个前沿…

X AI KOLs Following · 2026-06-30 缓存

详细介绍了一种训练小型LLM评判器来评估智能体输出的方法,取代了昂贵的前沿模型,并附带一个用于部署的Claude Code插件。

0 人收藏 0 人点赞
#llm-judge

我们测量的是策略还是措辞?LLM数学推理中表面多样性与策略多样性之间的差距

Hugging Face Daily Papers · 2026-06-29 缓存

本文引入了LLM数学推理中的策略多样性概念,表明表面多样性指标是不可靠的替代指标,而直接优化策略多样性仍是一个开放问题。

0 人收藏 0 人点赞
#llm-judge

@HamelHusain: 是的!二元评判对大多数人来说实用得多,因为李克特量表(或评分)有太多陷阱。所有…

X AI KOLs Timeline · 2026-06-28 缓存

Hamel Husain 分享了一份 AI 评估课程的闪卡和见解,主张在实际的 LLM 评估中使用二元评判而非李克特量表。

0 人收藏 0 人点赞
#llm-judge

基于认识论权利的LLM二阶偏见评估

arXiv cs.CL · 2026-06-17 缓存

本文介绍了“二阶偏见”,即LLM在判断有偏见内容时所表现出的偏见,并提出了一种基于认识论权利的推理任务来评估它。实验表明,该任务能够规避安全护栏,并揭示LLM评判者中系统性的群体偏见。

0 人收藏 0 人点赞
#llm-judge

在生产环境中评估AI代理之前我希望知道的事情

Reddit r/AI_Agents · 2026-06-16

关于在生产环境中评估AI代理的个人经验教训,包括将症状映射到各层、使用轨迹评估、校准LLM评判者、将失败转化为测试用例以及进行对抗性测试。

0 人收藏 0 人点赞
#llm-judge

LLM裁判存在暗电流:用于LLM-as-a-Judge评估的心理测量数据表

arXiv cs.CL · 2026-06-16 缓存

本文介绍了一种心理测量数据表协议,用于将LLM裁判作为测量工具进行评估,测量暗电流、位置虚假偏好、稳定交叉敏感性和目标敏感性。基于三个开放权重模型的案例研究揭示了裁判质量和行为的显著差异。

0 人收藏 0 人点赞
#llm-judge

RealMath-Eval:为何最先进的评判者难以应对真实人类推理

arXiv cs.AI · 2026-06-10 缓存

RealMath-Eval是一个包含224份真实高中数学考试答题的基准测试,揭示了显著的“评估差距”:相较于由LLM生成的合成解决方案(MSE约1.17),最先进的LLM评判者在真实人类推理上的表现较差(MSE约2.96),原因在于人类错误模式具有更高的多样性和惊异度。

0 人收藏 0 人点赞
#llm-judge

构建了一个开源、规范驱动的 AI 开发工具,可在同一功能上并行运行多个智能体,并由 LLM 评审选出最佳实现

Reddit r/AI_Agents · 2026-05-25

Aigon 是一款开源工具,可在同一功能上并行运行多个 AI 编码智能体(功能通过 Markdown 规范定义),并使用 LLM 评审选出最佳实现,配备可视化看板和可选调度功能。

0 人收藏 0 人点赞
#llm-judge

评估了一个RAG聊天机器人,最昂贵的模型表现最差。关于真正影响性能的因素的笔记。

Reddit r/LocalLLaMA · 2026-05-15

对RAG客户支持聊天机器人的详细评估揭示:检索问题常被误认为是LLM问题,启发式评估器具有误导性,去重可提升质量,严格基于文档的约束会在帮助性和准确性之间取舍,而模型扫查可在提升性能的同时大幅降低成本。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈