标签
本文介绍了 LLM-NRM,一种用于多选题基准的选项级心理测量框架,它对答案选择的完整分布进行建模,而不是二元正确性,表明错误回答携带了有用的测量信息,并提高了能力估计和基准测试的效率。
本文提出在法律基准测试中联合自动审计答案正确性与法律权威依据的 grounding,结果表明在普通提示词下,LLM 经常给出正确答案却引用错误的适用法条。
本文评估了临床医生的成对偏好能否可靠反映大语言模型(LLM)的临床安全性,使用了来自超过736名临床医生对13个模型的26,804条判断。研究发现,偏好排名与安全关键失败的相关性较弱,并提出了一种经临床调整的排名,能更好地纳入基于评分标准的安全性信号。
介绍了BBOWP-Bench,一个用于评估LLM在黑盒优化文字问题上的基准测试套件。在这些问题中,系统必须从自然语言描述中推断搜索空间和优化算法。初步结果显示,LLM能够选择合适算法,但在搜索空间设计方面存在困难。
本文提出了一个模块化的多智能体平台,用于对角色扮演语言智能体进行对抗性压力测试,通过策略驱动的审讯智能体和自动化评判智能体,揭示多轮对话中累积的行为失败。跨三个人设和三类LLM家族的实验表明,多策略对抗评估将鲁棒性得分降低0.17-0.20,并识别出常见的失败模式,且与人类评判高度一致。
介绍了MedPIC-Bench,一个包含反事实问题的基准测试,用于评估大型语言模型在患者特定条件变化时是否正确应用药物安全规则;在28个LLM中,反事实问题的准确率显著下降,揭示了模型普遍无法修正判断的缺陷。
This paper introduces CurveShift, an analysis method that separates overall ability gains from difficulty-specific improvements in LLM agents. Using METR time-horizon data and LiveCodeBench, it finds that most apparent shifts toward harder tasks are ceiling effects, though a genuine hard-task effect exists for reasoning models in competitive programming.
这篇 arXiv 预印本研究形成集成的十六个语言模型的语义离散度,表明平均而言集成多样性较小,且模型身份仅部分解释了哪个模型的差异最大。作者提出了一种逐模型异议贡献度量,并发现离散度由临床内容而非解释开放性所组织。
介绍了XL-DocBench,这是一个经过人工验证的超长文档理解基准,涵盖六个专业领域的1,519个问题,要求多页证据和结构化推理,表明当前大语言模型在处理长上下文专业文档时仍存在困难。
CalibratedRubric是一个任务自适应框架,用于为开放式LLM评估构建紧凑且可测量的评分标准库,通过贝叶斯可测量性过滤和基于IRT的选择,在金融、医疗、通用和法律基准上提升人类-金标准一致性和排序保真度。
介绍了 Hy-MultiTurn,一个用于深度多轮对话理解的中文基准,评估了 22 个前沿模型,涵盖六种受控模式(约束记忆、精确执行、约束合成、对象定位、动作抑制、指代消解),共 209 个任务,对话轮次从 12 轮到 76 轮不等。即使是最强的模型 GPT-5.5,也仅能满足 41.1% 的响应要求。
本文提出了一种以数据集为中心的元评估框架,在五个潜在维度上对LLM基准进行样本级审计,揭示其内部异质性,并支持基于标准的基准子集组合,以实现针对性的模型评估。
DungeonBench 是一个用于评估龙与地下城战斗中战术推理的新基准,在单个遭遇战和关联的冒险日中测试 AI 策略在规则丰富的决策任务上的表现。前沿语言模型通常能赢下直接战斗,但在更长周期内的资源预算和休息时机上表现不佳。
A research paper introducing Chain-of-Models (CoM), an automated pipeline where a second LLM audits a first model's reasoning trace to correct cognitive biases. It finds that auditor effectiveness depends on model family and bias type, and proposes a bias-specific auditor selection rule that improves judgment accuracy.
ModelEquivBench 是一个面向 LLM 生成优化模型的认证式多关系评估系统,报告逐对语义概况(涵盖七种等价关系),而非单一的准确率分数。它在固定基准上评估了 GPT-5.4、Claude Sonnet 4.6 和 Qwen3.5-397B-A17B,揭示了粗粒度基线无法发现的阶段式失败。
EarlyDx is a new large-scale benchmark for evaluating LLMs on open-ended, evidence-supported diagnosis generation at emergency department admission, built from 154,834 MIMIC-IV encounters. It reveals that even frontier and medical-specialized models struggle to synthesize admission-time evidence, with post-training only partially improving inference-dependent recall.
本文提出了一种使用自动化多模型LLM评审的基准测试协议来评估AI科学家系统,比较了Sakana AI、CycleResearcher和Data-to-Paper等框架,并发现FARS基准论文显著优于其他系统。
一篇新论文提出了SaliTrap,一个包含1,145个提示的基准测试,揭示了大语言模型知道任务不可能完成,但仍然会针对显式细节进行优化,这种失败被称为显著性偏差。即使是最好的模型,也只有约55%的时间能避开陷阱,而且察觉陷阱往往并不能阻止其遵从。
Sentdex 发推敦促 AI 公司停止在 AI 发布中过度优化基准测试工具,批评这种操纵评估指标的做法。
一位开发者构建了一个名为The Slop Index的开源基准,用于衡量18个AI模型产出“AI slop”的程度。它采用人类基线,并从简洁性、模板化、节奏、破绽和人类偏好五个维度进行评估。