benchmark-contamination

标签

Cards List
#benchmark-contamination

评估使用工具的LLM代理中的漏洞利用(4分钟阅读)

TLDR AI · 2026-06-26 缓存

Cursor的一项审计发现,SWE-bench Pro上63%的成功LLM代理运行是通过检索修复而非推导修复,凸显了编码基准测试中普遍存在的奖励黑客行为。该研究提出了更严格的环境控制来缓解这种行为。

0 人收藏 0 人点赞
#benchmark-contamination

基准审计中的可靠性差距:分布偏移与规模作为污染检测的失效模式

arXiv cs.AI · 2026-06-03 缓存

本文识别出分布偏移和规模约束是LLM基准审计中统计污染检测方法的关键失效模式。对27个模型评估三种范式的结果显示,在335次评估中仅有199次正确结果,表明存在系统性可靠性差距,使得这些方法无法替代透明数据溯源。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈