llm-evaluation

标签

Cards List
#llm-evaluation

每个错误答案都算数:LLM 多选题基准的选项级心理测量学

arXiv cs.CL · 4天前 缓存

本文介绍了 LLM-NRM,一种用于多选题基准的选项级心理测量框架,它对答案选择的完整分布进行建模,而不是二元正确性,表明错误回答携带了有用的测量信息,并提高了能力估计和基准测试的效率。

0 人收藏 0 人点赞
#llm-evaluation

知其形,不知其用:自动审计法律基准中的答案与权威依据脱钩

arXiv cs.CL · 4天前 缓存

本文提出在法律基准测试中联合自动审计答案正确性与法律权威依据的 grounding,结果表明在普通提示词下,LLM 经常给出正确答案却引用错误的适用法条。

0 人收藏 0 人点赞
#llm-evaluation

受偏好并非更安全:成对偏好作为临床安全性的代理指标并不可靠

arXiv cs.CL · 4天前 缓存

本文评估了临床医生的成对偏好能否可靠反映大语言模型(LLM)的临床安全性,使用了来自超过736名临床医生对13个模型的26,804条判断。研究发现,偏好排名与安全关键失败的相关性较弱,并提出了一种经临床调整的排名,能更好地纳入基于评分标准的安全性信号。

0 人收藏 0 人点赞
#llm-evaluation

BBOWP-Bench:评估LLM在黑盒优化文字问题上的性能

arXiv cs.CL · 4天前 缓存

介绍了BBOWP-Bench,一个用于评估LLM在黑盒优化文字问题上的基准测试套件。在这些问题中,系统必须从自然语言描述中推断搜索空间和优化算法。初步结果显示,LLM能够选择合适算法,但在搜索空间设计方面存在困难。

0 人收藏 0 人点赞
#llm-evaluation

使用多智能体评估对角色扮演语言智能体进行对抗性压力测试

arXiv cs.AI · 4天前 缓存

本文提出了一个模块化的多智能体平台,用于对角色扮演语言智能体进行对抗性压力测试,通过策略驱动的审讯智能体和自动化评判智能体,揭示多轮对话中累积的行为失败。跨三个人设和三类LLM家族的实验表明,多策略对抗评估将鲁棒性得分降低0.17-0.20,并识别出常见的失败模式,且与人类评判高度一致。

0 人收藏 0 人点赞
#llm-evaluation

评估药物安全推理中对患者信息的反事实敏感性

arXiv cs.AI · 4天前 缓存

介绍了MedPIC-Bench,一个包含反事实问题的基准测试,用于评估大型语言模型在患者特定条件变化时是否正确应用药物安全规则;在28个LLM中,反事实问题的准确率显著下降,揭示了模型普遍无法修正判断的缺陷。

0 人收藏 0 人点赞
#llm-evaluation

CurveShift: Is Agent Progress Scalar? Separating Level from Shape

arXiv cs.CL · 5天前 缓存

This paper introduces CurveShift, an analysis method that separates overall ability gains from difficulty-specific improvements in LLM agents. Using METR time-horizon data and LiveCodeBench, it finds that most apparent shifts toward harder tasks are ceiling effects, though a genuine hard-task effect exists for reasoning models in competitive programming.

0 人收藏 0 人点赞
#llm-evaluation

十六个模型,不足两种声音:在无唯一正确答案时衡量集成离散度

arXiv cs.CL · 5天前 缓存

这篇 arXiv 预印本研究形成集成的十六个语言模型的语义离散度,表明平均而言集成多样性较小,且模型身份仅部分解释了哪个模型的差异最大。作者提出了一种逐模型异议贡献度量,并发现离散度由临床内容而非解释开放性所组织。

0 人收藏 0 人点赞
#llm-evaluation

XL-DocBench:证据支撑的超长文档理解基准测试

arXiv cs.CL · 5天前 缓存

介绍了XL-DocBench,这是一个经过人工验证的超长文档理解基准,涵盖六个专业领域的1,519个问题,要求多页证据和结构化推理,表明当前大语言模型在处理长上下文专业文档时仍存在困难。

0 人收藏 0 人点赞
#llm-evaluation

CalibratedRubric:面向开放式LLM评估的任务自适应评分标准库

arXiv cs.CL · 6天前 缓存

CalibratedRubric是一个任务自适应框架,用于为开放式LLM评估构建紧凑且可测量的评分标准库,通过贝叶斯可测量性过滤和基于IRT的选择,在金融、医疗、通用和法律基准上提升人类-金标准一致性和排序保真度。

0 人收藏 0 人点赞
#llm-evaluation

Hy-MultiTurn:面向深度多轮对话理解的六维基准

arXiv cs.CL · 6天前 缓存

介绍了 Hy-MultiTurn,一个用于深度多轮对话理解的中文基准,评估了 22 个前沿模型,涵盖六种受控模式(约束记忆、精确执行、约束合成、对象定位、动作抑制、指代消解),共 209 个任务,对话轮次从 12 轮到 76 轮不等。即使是最强的模型 GPT-5.5,也仅能满足 41.1% 的响应要求。

0 人收藏 0 人点赞
#llm-evaluation

基准并非铁板一块:面向LLM评估的样本级审计与编排

arXiv cs.CL · 6天前 缓存

本文提出了一种以数据集为中心的元评估框架,在五个潜在维度上对LLM基准进行样本级审计,揭示其内部异质性,并支持基于标准的基准子集组合,以实现针对性的模型评估。

0 人收藏 0 人点赞
#llm-evaluation

DungeonBench:龙与地下城战斗中规则丰富的战术推理基准

arXiv cs.AI · 6天前 缓存

DungeonBench 是一个用于评估龙与地下城战斗中战术推理的新基准,在单个遭遇战和关联的冒险日中测试 AI 策略在规则丰富的决策任务上的表现。前沿语言模型通常能赢下直接战斗,但在更长周期内的资源预算和休息时机上表现不佳。

0 人收藏 0 人点赞
#llm-evaluation

Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges

arXiv cs.CL · 6天前 缓存

A research paper introducing Chain-of-Models (CoM), an automated pipeline where a second LLM audits a first model's reasoning trace to correct cognitive biases. It finds that auditor effectiveness depends on model family and bias type, and proposes a bias-specific auditor selection rule that improves judgment accuracy.

0 人收藏 0 人点赞
#llm-evaluation

ModelEquivBench:LLM生成优化模型的认证式多关系评估

arXiv cs.AI · 6天前 缓存

ModelEquivBench 是一个面向 LLM 生成优化模型的认证式多关系评估系统,报告逐对语义概况(涵盖七种等价关系),而非单一的准确率分数。它在固定基准上评估了 GPT-5.4、Claude Sonnet 4.6 和 Qwen3.5-397B-A17B,揭示了粗粒度基线无法发现的阶段式失败。

0 人收藏 0 人点赞
#llm-evaluation

EarlyDx: An Admission-Anchored Benchmark for Open-Ended Generation of Evidence-Supported ED-Encounter Diagnoses

arXiv cs.AI · 6天前 缓存

EarlyDx is a new large-scale benchmark for evaluating LLMs on open-ended, evidence-supported diagnosis generation at emergency department admission, built from 154,834 MIMIC-IV encounters. It reveals that even frontier and medical-specialized models struggle to synthesize admission-time evidence, with post-training only partially improving inference-dependent recall.

0 人收藏 0 人点赞
#llm-evaluation

AI能否评估AI科学家?一项使用自动化多模型评审的自主研究生成系统基准测试研究

arXiv cs.AI · 6天前 缓存

本文提出了一种使用自动化多模型LLM评审的基准测试协议来评估AI科学家系统,比较了Sakana AI、CycleResearcher和Data-to-Paper等框架,并发现FARS基准论文显著优于其他系统。

0 人收藏 0 人点赞
#llm-evaluation

@rohanpaul_ai:大语言模型可能知道任务不可能完成,却仍然会优化它。问是步行还是开车去50米外的洗车店…

X AI KOLs Following · 2026-08-02 缓存

一篇新论文提出了SaliTrap,一个包含1,145个提示的基准测试,揭示了大语言模型知道任务不可能完成,但仍然会针对显式细节进行优化,这种失败被称为显著性偏差。即使是最好的模型,也只有约55%的时间能避开陷阱,而且察觉陷阱往往并不能阻止其遵从。

0 人收藏 0 人点赞
#llm-evaluation

@Sentdex: 致AI公司:请立即停止在你们那些基准测试调校过的测试框架上过度优化(harnessmaxxing)

X AI KOLs Timeline · 2026-08-02 缓存

Sentdex 发推敦促 AI 公司停止在 AI 发布中过度优化基准测试工具,批评这种操纵评估指标的做法。

0 人收藏 0 人点赞
#llm-evaluation

我对18个AI模型做了基准测试:哪个写出来的东西最不像“AI slop”

Reddit r/artificial · 2026-08-02

一位开发者构建了一个名为The Slop Index的开源基准,用于衡量18个AI模型产出“AI slop”的程度。它采用人类基线,并从简洁性、模板化、节奏、破绽和人类偏好五个维度进行评估。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈