open-ended-evaluation

标签

Cards List
#open-ended-evaluation

The Evaluator Is Part of the Experiment: Measuring Open-Ended LLM Conformity

arXiv cs.CL · 2026-08-06 缓存

This paper introduces an experimental protocol to measure open-ended LLM conformity, showing that wrong peer input degrades revision quality and that evaluators are not neutral when shown peer context, highlighting the need for anchor calibration.

0 人收藏 0 人点赞
#open-ended-evaluation

DualEval:面向统一LLM评估的联合模型-项目校准

arXiv cs.LG · 2026-06-26 缓存

介绍了DualEval框架,该框架联合校准模型能力与项目难度/锐度,以统一静态基准和竞技场式评估,从而实现更可靠的排名以及基准压缩和异常检测等下游应用。

0 人收藏 0 人点赞
#open-ended-evaluation

RubricsTree:跨健康记忆与医疗技能的个人健康智能体可扩展且不断演进的开放式评估

arXiv cs.CL · 2026-06-17 缓存

RubricsTree 提出了一种可扩展且与专家对齐的个人健康智能体评估框架,使用超过100个原子布尔规则,在Gemini、GPT和Qwen模型系列的HealthBench上实现了高达66%的相对提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈