open-ended-evaluation

标签

Cards List
#open-ended-evaluation

CruxBench:信息发现能力基准测试

arXiv cs.CL ↗ · 5天前 缓存

CruxBench 是一个新的基准测试,用于评估大语言模型(LLM)发现有价值信息的能力——它将预测问题分解为信息量大的子问题("cruxes"),并以信息价值(Value of Information, VOI)进行评分。在 293 道预测问题上的评测结果显示,VOI 与模型能力高度相关(r=0.90),但前沿模型的表现仍然几乎仅略优于随机时机的基线水平。

0 人收藏 0 人点赞
#open-ended-evaluation

The Evaluator Is Part of the Experiment: Measuring Open-Ended LLM Conformity

arXiv cs.CL ↗ · 2026-08-06 缓存

This paper introduces an experimental protocol to measure open-ended LLM conformity, showing that wrong peer input degrades revision quality and that evaluators are not neutral when shown peer context, highlighting the need for anchor calibration.

0 人收藏 0 人点赞
#open-ended-evaluation

DualEval:面向统一LLM评估的联合模型-项目校准

arXiv cs.LG ↗ · 2026-06-26 缓存

介绍了DualEval框架,该框架联合校准模型能力与项目难度/锐度,以统一静态基准和竞技场式评估,从而实现更可靠的排名以及基准压缩和异常检测等下游应用。

0 人收藏 0 人点赞
#open-ended-evaluation

RubricsTree:跨健康记忆与医疗技能的个人健康智能体可扩展且不断演进的开放式评估

arXiv cs.CL ↗ · 2026-06-17 缓存

RubricsTree 提出了一种可扩展且与专家对齐的个人健康智能体评估框架,使用超过100个原子布尔规则,在Gemini、GPT和Qwen模型系列的HealthBench上实现了高达66%的相对提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈