标签
CruxBench 是一个新的基准测试,用于评估大语言模型(LLM)发现有价值信息的能力——它将预测问题分解为信息量大的子问题("cruxes"),并以信息价值(Value of Information, VOI)进行评分。在 293 道预测问题上的评测结果显示,VOI 与模型能力高度相关(r=0.90),但前沿模型的表现仍然几乎仅略优于随机时机的基线水平。
This paper introduces an experimental protocol to measure open-ended LLM conformity, showing that wrong peer input degrades revision quality and that evaluators are not neutral when shown peer context, highlighting the need for anchor calibration.
介绍了DualEval框架,该框架联合校准模型能力与项目难度/锐度,以统一静态基准和竞技场式评估,从而实现更可靠的排名以及基准压缩和异常检测等下游应用。
RubricsTree 提出了一种可扩展且与专家对齐的个人健康智能体评估框架,使用超过100个原子布尔规则,在Gemini、GPT和Qwen模型系列的HealthBench上实现了高达66%的相对提升。