QuoteBench: 匹配分数如何掩盖命令路径失败
摘要
QuoteBench 揭示了执行边界解析错误显著降低了大型语言模型编程代理的成功率,并且披露边界有助于恢复性能,这表明评估必须考虑部署配置,而不是将匹配分数视为模型的内在属性。
查看缓存全文
缓存时间: 2026/08/21 16:10
论文页面 - QuoteBench:匹配分数如何掩盖命令路径故障
来源:https://huggingface.co/papers/2608.13547 发布于8月13日
·
提交者https://huggingface.co/lsamc
lsamc (https://huggingface.co/lsamc)于8月21日
摘要
QuoteBench揭示:执行边界解析错误会显著降低LLM编程智能体的成功率,而披露该边界信息有助于恢复性能。这表明评估必须考虑部署配置,而非将匹配分数视为模型的固有属性。
LLM编程智能体 (https://huggingface.co/papers?q=LLM%20coding%20agents) 通过可能对模型输出进行序列化、包装和重新解析的接口发布Bash命令 (https://huggingface.co/papers?q=Bash%20commands)。仅凭匹配的执行分数无法区分命令生成错误与生成后引入的故障。QuoteBench (https://huggingface.co/papers?q=QuoteBench) 通过在56个来自14个事件衍生类别的单次任务上进行精确的最终状态验证 (https://huggingface.co/papers?q=final-state%20validation) 来衡量此边界,其中包含一个故意未转义的附加解析器 (https://huggingface.co/papers?q=parser),从而在生成契约 (https://huggingface.co/papers?q=generation%20contract) 与执行传输 (https://huggingface.co/papers?q=execution%20transport) 之间产生冲突。在插值点处转义可以重现每个重放回复的原始路径结果,因此在披露边界下的任何性能恢复必须来自模型生成方式的改变。在八种相同窗口配置中,通过附加解析器 (https://huggingface.co/papers?q=parser) 重放相同回复使成功率降低了55.4至73.2个百分点;对于六种配置,披露边界可恢复30.4至60.7个百分点,其余两种配置恢复为零或略微为负。原始生成能力在前沿已接近饱和;边界适应 (https://huggingface.co/papers?q=boundary%20adaptation) 仍是区分模型的关键。GPT-5.6-sol的匹配差距为-3.6分,但这掩盖了-64.3分的损害和+60.7分的补偿。部署配置重新排列了模型排名:26对可比配置中有一处明确的逆转,另有四处处于单任务边界。命令发布智能体的评估应报告模型配置、生成契约 (https://huggingface.co/papers?q=generation%20contract)、执行路径、工作点和最终状态验证器,而非将匹配分数视为模型的固有属性。
查看arXiv页面 (https://arxiv.org/abs/2608.13547)查看PDF (https://arxiv.org/pdf/2608.13547)项目页面 (https://quotebench.lsamc.website/)GitHub3 (https://github.com/LeonardNJU/quoteBench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.13547)
在智能体中获取本文:
hf papers read 2608\.13547
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接本文
在模型README.md中引用arxiv.org/abs/2608.13547以从本页面链接。
引用本文的数据集1
lsamc/QuoteBench-Rollouts查看器• 更新于6天前 • 13k • 373 • 1 (https://huggingface.co/datasets/lsamc/QuoteBench-Rollouts)
引用本文的Space0
无Space链接本文
在Space的README.md中引用arxiv.org/abs/2608.13547以从本页面链接。
包含本文的收藏0
无收藏包含本文
将本文添加到收藏 (https://huggingface.co/new-collection)以从本页面链接。
相似文章
分数持平,失败放大:误差预算如何掩盖量化LLM智能体的损害
本文研究了关于4位权重量化对LLM智能体几乎无损的说法,表明虽然整体基准分数持平,但量化放大了现有的工具调用失败(例如幻觉),这些失败被基准的误差预算所掩盖。作者建议报告每通道错误率以及在缩小预算下的成功率,以揭示被掩盖的损害。
基准测试末日
本文揭示了大型语言模型如何轻松操纵性能基准测试,导致虚假的软件优化声明,例如一个过度拟合基准的正则表达式引擎。
如何让不支持的工具调用响应在LLM基准测试中变得“完全稳定”
LLM基准测试的评分流程可能由于预处理而错误地将不支持的工具调用响应视为稳定的空输出,这凸显了在评估中区分解析失败和真实输出的重要性。
基准测试上25%的差异——只是运行方式的一个错误😬
讨论了ARC-AGI上25%的差异如何由测试框架设置导致,显示GPT-5.6 Sol在正确评估下得分38%,并批评了行业内天真的基准测试报告方式。
Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance
This position paper argues that long-horizon benchmark failures must be compared against baselines built from matched short stages, introducing the 'horizon residual' metric to distinguish task size from task difficulty in LLM agent evaluation.